ProgramBench Vetted yapay zeka tersine mühendislik testlerini yeniledi
Öne çıkanlar
- ProgramBench Vetted, derlenmiş ikili dosyaları yeniden kodlama odaklı 50 görev sunuyor.
- Boru hattında otomatik hakemler, onarıcı modeller ve insan denetçiler birlikte çalıştı.
- Claude Opus 5 görevlerin yüzde 14'ünü tamamen çözerek ilk sırada yer aldı.
- GPT 5.5 yüzde 85,2 ile en yüksek ortalama ödül oranına ulaştı.
Vetto ekibi, yapay zeka modellerinin derlenmiş ikili dosyalardan kaynak kod üretme becerisini ölçen ProgramBench Vetted test setini yayımladı. Meta tarafından duyurulan ProgramBench temel alınarak hazırlanan yeni sürüm, 50 doğrulanmış görev içeriyor. Yeni sürüm, orijinal setteki test tekrarları, ortam sızıntıları ve kısayol hileleri gibi değerlendirme hatalarını gidermeyi hedefliyor.
Sistemde görevlerin oluşturulması ve denetlenmesi için çok aşamalı bir boru hattı kullanıldı. Aday görevler beş öncü model tarafından üretilen testlerle araştırıldı, ardından uzman yapay zeka hakemleri ve onarıcı ajanlar devreye girdi. Kapsamlı otomatik döngülerin ardından çözülemeyen durumlar insan araştırmacılar tarafından incelendi. Değerlendirme ortamındaki komut satırı hileleri ve ulaşılamaz gereksinimler temizlendi.
Yayımlanan kıyaslama tablosunda 17 farklı model değerlendirildi. GPT 5.5 modeli yüzde 85,2 ile en yüksek ortalama ödülü alırken görevlerin yalnızca yüzde 2'sini tamamen çözebildi. Claude Opus 5 ise yüzde 81,9 ortalama ödül almasına rağmen yüzde 14 tam çözüm oranıyla liderliği elde etti. Test edilen modellerden yalnızca altısı en az bir görevi eksiksiz tamamlayabildi.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.