Tipli karar modelleri için JevBench test sonuçları yayımlandı
Öne çıkanlar
- Jev 1.13.0 modeli 74,4 genel puan alarak 48 model arasında ilk sıraya yerleşti.
- Genel sıralamada üçüncü olan djev, üç ayrı alt kategoride en yüksek puanı topladı.
- Büyük modellerden GPT-5.6 Luna 14'üncü, Gemini 3.1 Flash-Lite ise 25'inci sırada kaldı.
Benchmark Heaven platformu tipli karar modellerinin başarımını ölçen tekrarlanabilir JevBench karşılaştırma sonuçlarını yayımladı. Listede yer alan 48 farklı model ve varyant, genel JevBench puanının yanı sıra dört ayrı alt metrik üzerinden değerlendirildi. Jev 1.13.0 sürümü genel sıralamada 74,4 puan alarak birinci oldu. SemIf 73,1 puanla ikinci sıraya yerleşirken, djev modeli ise 73,0 puanla üçüncü sırayı elde etti.
Sonuçlar, genel sıralama ile alt test başarım sıraları arasında belirgin farklılıklar bulunduğunu gösterdi. Genel listede üçüncü olan djev, değerlendirilen üç alt testte en yüksek skoru alarak birinci sıraya yükseldi. Benzer şekilde genel sıralamada 19'uncu sırada kalan 0,6 milyar parametreli kev modeli, sonuncu değerlendirme metriğinde 70,4 puan alarak zirveye oturdu. Sıralamanın üst basamaklarında Winnow-12B Q8 71,2 puan ve reflex 4B 70,3 puan ile kendilerine yer buldu.
Karşılaştırmada genel amaçlı büyük dil modelleri ve özel yeniden sıralama modelleri de test edildi. GPT-5.6 Luna 65,9 puanla 14'üncü olurken Gemini 3.1 Flash-Lite 60,1 puanla 25'inci sırada kaldı. Listenin alt sıralarında yer alan bazı genel amaçlı yeniden sıralama modelleri ise tek haneli puanlarda kalarak karar modellerine kıyasla düşük başarı gösterdi.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.