Ana içeriğe geç
Yapay Zeka

Yapay zeka modellerinde görsel gösteri testleri yanıltıyor

Öne çıkanlar

  • Sabit gösteri testleri laboratuvarların modelleri bu görevlere özel eğitmesine yol açıyor.
  • Thinking Machines'in Inkling Small modeli amiral gemisi modelini bazı testlerde geride bıraktı.
  • LiveBench ve ARC-AGI gibi sistemler soru setlerini gizleyerek ezberlemeyi engellemeye çalışıyor.

Yeni yapay zeka modellerinin çıkışında tek komutla Minecraft üretmek veya bisiklete binen pelikan çizimi yaptırmak gibi görsel testler sosyal medyada öne çıkıyor. Bu tarz testler kullanıcılar için etkileyici görünse de laboratuvarların modelleri doğrudan bu belirli görevlere göre optimize etmesine zemin hazırlıyor. Değişmeyen ve kamuya açık olan hedefler, sonraki sürümlerde modellerin gerçek kapasitesinden ziyade testlere aşırı uyum sağlamasını kolaylaştırıyor.

Benzer bir aşırı uyum sorunu halka açık test havuzlarında ve kıyaslama platformlarında da yaşanıyor. Daha küçük parametreli modeller, eğitim verilerine sızan test soruları sayesinde pratikte daha zayıf kalsalar bile Artificial Analysis gibi listelerde amiral gemisi modellerle yarışabiliyor. Thinking Machines tarafından geliştirilen Inkling Small modeli, parametre sayısının üçte birinden daha azına sahip olmasına rağmen amiral gemisi modelle benzer puanlar alıyor ve Humanity's Last Exam ile GPQA Diamond testlerinde onu geçiyor.

Araştırmacılar sabit testlerin oluşturduğu bu yanılsamayı kırmak için soruların sürekli güncellendiği veya gizli tutulduğu değerlendirme sistemlerine yöneliyor. LiveBench soruları düzenli olarak yenilerken ARC-AGI ve Humanity's Last Exam test kümelerinin bir bölümünü gizli tutuyor. Buna rağmen görsel demoların sosyal medyadaki pazarlama etkisi, kamuya açık benchmark tartışmalarını teknik derinlikten uzaklaştırmaya devam ediyor.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.