Ana içeriğe geç
Yapay Zeka

OpenRouter üzerinden yapay zeka modelleri çalıştırmanın gizli maliyetleri ortaya çıktı

Öne çıkanlar

  • Aynı DeepSeek model ağırlıklarında sağlayıcılar arasında araç çağırma testlerinde 20 puana varan farklar görüldü.
  • Bazı sağlayıcılar görsel verileri işleyemediği halde HTTP 200 başarılı durum kodu döndürdü.
  • Nicelleştirme filtreleri model kalitesini doğrudan artırmadı ve yedek sunucu havuzunu daralttı.

iMessage üzerinde çalışan Olly adlı yapay zeka asistanının geliştiricisi, 18 milyondan fazla mesajlık üretim deneyiminin ardından OpenRouter platformuna dair teknik bulgularını paylaştı. Açık kaynaklı yapay zeka modellerini yönlendiren platformun, aynı model ağırlıklarını sunan farklı sağlayıcılar arasında büyük performans ve güvenilirlik uçurumları barındırdığı bildirildi. Paylaşılan veriler, kağıt üzerinde özdeş olan modellerin gerçek dünyada farklı sonuçlar ürettiğini gösteriyor.

DeepSeek V4 Flash modeli üzerinde yapılan testlerde birinci parti sunucunun GPQA testinde yüzde 90, araç çağırma görevinde ise yüzde 81 başarı gösterdiği; ancak aynı ağırlıkları sunan DigitalOcean altyapısının sırasıyla yüzde 75 ve yüzde 58 seviyelerinde kaldığı aktarıldı. Görsel modellerde bazı sağlayıcıların görüntüleri hiç işlemeden başarılı yanıt kodu döndürdüğü, araç çağırma komutlarının yapılandırılmış veri yerine metin içinde kaybolduğu ve düşünme parametrelerinin her sağlayıcıda farklı işlendiği kaydedildi.

Geliştirici, tekil sağlayıcıları sabitlemenin altyapı çökmelerine veya ani hız kısıtlamalarına yol açtığını belirterek testlerin doğrudan üretim sunucularından yapılması gerektiğini ifade etti. Sayısal hassasiyet filtrelerinin kalite göstergesi olmadığını vurgulayan geliştirici, sağlayıcı bazlı dönüştürme ve hata yönetimi katmanlarının kurulmasını önerdi.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.