Ana içeriğe geç
Yapay Zeka

Jev modeli Reddit testinde dil modelleriyle yarıştı

Öne çıkanlar

  • Jev, 770 Reddit gönderisindeki haklılık tahmininde Sonnet'in hemen arkasında ikinci oldu.
  • Jev medyan çağrılarda Sonnet'ten 6,3 kat daha hızlı ve 62 kat daha ucuza çalıştı.
  • Temel oranları aşmayı yalnızca Claude 3.5 Sonnet ve Jev başarabildi.

Bağımsız bir araştırmacı, TypeSafe tarafından geliştirilen sınıflandırma odaklı "System One" modeli Jev'i Reddit'in r/AmItheAsshole topluluğundaki 770 paylaşım üzerinden dil modelleriyle karşılaştırdı. Modellerin kullanıcıların haklılık kararlarını tahmin etme performansını ölçen yedi aşamalı testte Jev, Claude 3.5 Sonnet'in ardından ikinci sırayı aldı. Değerlendirmede 0,369 Brier puanı elde eden Jev, Sonnet'in 0,344'lük skoruna yaklaşırken GPT-5 nano ve yerel açık ağırlıklı modelleri geride bıraktı.

Araştırma, metin üretmeyen ve doğrudan olasılık döndüren Jev'in hız ve maliyet avantajını ortaya koydu. Jev, Sonnet'e kıyasla çağrı başına ortalama 6,3 kat daha hızlı çalıştı ve 62 kat daha düşük maliyet üretti. TypeSafe'in 40 ila 200 kat hız iddiası gerçekleşmedi; ancak Jev'in 0,39 saniyelik medyan yanıt süresi şirketin taahhüt ettiği 70-500 milisaniye aralığında kaldı. GPT-5 nano'ya karşı ise yapılandırmaya bağlı olarak 3,9 ila 12 kat hız farkı kaydedildi.

Test sonuçları, hiçbir model kullanmadan Reddit'in genel dağılımını tahmin etmenin bile yüzde 74 doğruluk sağladığını gösterdi. Yalnızca Sonnet ve Jev bu taban tahmin oranını anlamlı biçimde aşmayı başardı. Azınlıkta kalan karmaşık kararları tahmin etmekte tüm modeller zorlanırken, lojistik regresyon kalibrasyonu uygulandığında Jev ile Sonnet arasındaki performans farkı istatistiksel olarak belirsiz seviyeye geriledi.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.