Ana içeriğe geç
Yapay Zeka

Fizik testlerindeki hatalar yapay zeka modellerinin başarısını düşük gösterdi

Öne çıkanlar

  • Uzman denetimi, fizik testlerindeki birçok başarısızlığın modelden değil hatalı referans çözümlerden kaynaklandığını gösterdi.
  • GPT-5.6-Sol modelinin HLE-Physics skoru düzeltmeler sonrasında yüzde 47,3 seviyesinden yüzde 78,7 seviyesine yükseldi.
  • Model, CritPt testinde geriye kalan 54 soruluk kümede yüzde 94,4 başarı oranına ulaştı.

Araştırmacılar, 11 Eylül 2026 tarihinde yayımladıkları çalışmada önde gelen yapay zeka modellerinin fizik testlerindeki düşük başarı oranlarını uzman denetimiyle yeniden inceledi. Değerlendirme süreçlerindeki hatalar, yanlış referans çözümler ve belirsiz soru metinleri nedeniyle modellerin bilimsel akıl yürütme becerilerinin mevcut testlerde gerçeğin altında puanlandığı belirlendi.

Fizik alanındaki öğretim üyeleri ve lisansüstü araştırmacılardan oluşan uzman ekip; HLE-Physics, CMT-Benchmark ve CritPt dahil altı yaygın test kümesindeki metin tabanlı soruları doğrudan denetledi. İncelenen hatalı yanıtların çoğunun modelin muhakeme eksikliğinden değil, hatalı puanlama yazılımlarından ve problemlerdeki eksik tanımlardan kaynaklandığı ortaya çıktı. Uzmanlar hatalı referans çözümleri düzeltti ve kusurlu soruları eleyerek alt kümeleri yeniden yapılandırdı.

Düzeltmelerin ardından GPT-5.6-Sol modelinin HLE-Physics üzerindeki ortalama başarı oranı yüzde 47,3 seviyesinden yüzde 78,7 seviyesine çıktı. Modelin CMT-Benchmark skoru yüzde 61,0 değerinden yüzde 87,2 seviyesine yükselirken, elenmeyen 54 CritPt sorusundaki pass@4 başarısı yüzde 94,4 değerine ulaştı. Araştırma ekibi, kapalı uçlu fizik problemlerinde doygunluğa yaklaşıldığını belirterek uzman onaylı yeni nesil testlere ihtiyaç duyulduğunu kaydetti.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.