Ana içeriğe geç
Yapay Zeka

Terminal-Bench-Science yapay zeka ajanlarını bilimsel araştırmalarda test ediyor

Öne çıkanlar

  • Terminal-Bench-Science 0.1, beş temel bilimsel disiplinden 70 gerçek araştırma görevini kapsıyor.
  • En iyi performansı gösteren Claude Opus 5 görevlerin yalnızca yüzde 30'unu başarıyla tamamladı.
  • Değerlendirmeye sunulan 920 görev önerisinden sadece 70'i kalite standartlarını geçerek kıyaslamaya dahil edildi.

Stanford Üniversitesi araştırmacıları ve bilim insanlarından oluşan uluslararası bir ekip, yapay zeka ajanlarının bilimsel araştırma süreçlerindeki yetkinliğini ölçmek amacıyla Terminal-Bench-Science adlı yeni bir değerlendirme ortamı yayımladı. İlk sürüm olan 0.1, yaşam bilimleri, fizik, yer bilimleri, matematik ve mühendislik alanlarından seçilen 70 gerçek araştırma görevini içeriyor. Proje, ders kitabı soruları yerine araştırmacıların günlük çalışma akışlarında karşılaştığı simülasyon, veri analizi ve teorem kanıtlama gibi karmaşık problemleri temel alıyor.

İlk sürüm kapsamında değerlendirilen modeller arasında en yüksek başarıyı yüzde 30'luk çözüm oranıyla Claude Opus 5 elde etti. Sıralamada Claude Opus 5'i yüzde 22,4 ile GPT-5.6 Sol ve yüzde 21,4 ile Claude Fable 5 takip etti. Değerlendirmeye alınan birçok güncel modelin çözüm oranı yüzde 10'un altında kaldı. Görev havuzu, araştırmacılar tarafından sunulan 920 öneri arasından titiz bir inceleme sürecinin ardından seçilen 70 senaryoyla oluşturuldu.

Araştırmacılar, bu platformu tek seferlik bir akademik çalışma olarak bırakmak yerine düzenli sürümlerle güncellenen sürekli bir ölçüt olarak konumlandırıyor. Açık kaynaklı bir süreçle işletilen projede, modellerin doyum noktasına ulaştığı görevler emekliye ayrılacak ve yeni bilimsel zorluklar eklenecek. Ekip, Terminal-Bench-Science 0.2 sürümü için görev kabul sürecini başlattı.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.