Bespoke Labs yapay zeka araştırmacıları için AutoResearchExam testini duyurdu
Öne çıkanlar
- AutoResearchExam, yapay zeka ajanlarını 29 açık uçlu makine öğrenmesi görevinde 24 saat boyunca test ediyor.
- Ajanlar yalnızca doğrulama skorunu görürken, nihai başarı gizli test AUARC metriğiyle hesaplanıyor.
- Fazla sayıda teslimat yapmak skoru doğrudan artırmıyor; araştırma adımlarının kalitesi sonucu belirliyor.
Bespoke Labs, yapay zeka ajanlarının açık uçlu makine öğrenmesi araştırma problemlerini çözme ve genelleme yeteneklerini ölçen AutoResearchExam adlı kıyaslama testini tanıttı. Yeni sistem, 29 farklı görevden oluşuyor ve modellerin 24 saatlik süre boyunca gizli test skorlarını nasıl iyileştirdiğini takip ediyor. Klasik tek adımlı veya birkaç adımlı değerlendirmelerin uzun soluklu araştırma dinamiklerini yansıtmadığını belirten ekip, model performansını zamana yayılmış çıktılar üzerinden ölçüyor.
Değerlendirme sürecinde modeller Terminus 2 altyapısını kullanarak internet erişimi olmadan bağımsız çalışma ortamlarında görev yapıyor. Ajanlar çalışma süresince yalnızca doğrulama skorlarını ve kalan zaman bilgisini görüyor; asıl puanlama ise gizli test verileri üzerinden AUARC (AutoResearch Eğrisi Altındaki Alan) metriğiyle hesaplanıyor. Böylece modellerin sadece doğrulama verilerine aşırı uyum (overfitting) sağlayıp sağlamadığı ile çözümlerin görünmeyen verilere ne kadar genellendiği ayrıştırılıyor.
Elde edilen ilk bulgulara göre, modeller 24 saatlik süre boyunca çözümlerini geliştirmeye devam ediyor ve Muse Spark 1.3'ün çalışmalarının yaklaşık yüzde 79'unda 12 saatten sonra da ilerleme kaydediliyor. Öte yandan yüksek sayıda deneme yapmanın tek başına başarıyı artırmadığı, araştırma adımlarının niteliğinin kritik olduğu görüldü. Anthropic modelleri Fable ve Opus'un sadece hiperparametre ayarlama turlarına daha az zaman harcayarak yerel doğrulamaya odaklandığı bildirildi.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.