Ana içeriğe geç
Yapay Zeka

Artificial Analysis yapay zeka kıyaslama dizinini güncelledi

Öne çıkanlar

  • Özel test verisi ağırlığı yüzde 40'a çıkarılarak değerlendirmelerin manipüle edilmesi zorlaştırıldı.
  • AA-Briefcase ve 4 bin 592 sayfalık GDP.pdf testleri kıyaslama paketine dahil edildi.
  • Claude Fable 5.1 genel endekste ilk sırayı alırken GPT-6 Astra ikinci basamakta yer aldı.

Artificial Analysis, yapay zeka modellerini karşılaştırdığı Intelligence Index dizininin v4.2 sürümünü 4 Eylül 2026 tarihinde yayımladı. Yeni sürüm, hızla ilerleyen sektör standartlarına uyum sağlamak ve modellerin test sonuçlarını manipüle etmesini önlemek amacıyla daha karmaşık görevler içeriyor. Şirket, modellerin yanıtlarını önceden ezberlemesini engellemek için kamuya kapalı özel test kümelerinin ağırlığını iki katına çıkararak yüzde 40 seviyesine yükseltti.

Güncelleme kapsamında uzmanlar tarafından hazırlanan karmaşık projeleri içeren AA-Briefcase ve 4 bin 592 sayfalık belge analizini kapsayan Surge GDP.pdf testleri dizine eklendi. Doygunluğa ulaşan GPQA Diamond testi ise değerlendirmeden çıkarıldı. Yapılan altyapı iyileştirmeleriyle puanlama sistemlerindeki belirsizlikler giderildi, kod testlerindeki sanal alanların doğruluğu artırıldı ve Elo ölçeği daha istikrarlı hale getirildi.

Sonuçlara göre Anthropic tarafından geliştirilen Claude Fable 5.1 endeksin zirvesinde yer aldı. OpenAI imzalı GPT-6 Astra ikinci sıraya yerleşirken Meta üçüncü laboratuvar oldu; bu modelleri SpaceXAI, Moonshot/Kimi, Z.AI ve Google takip etti. GPT-6 Astra, GDP.pdf testinde yüzde 33,2 başarı oranıyla liderliği alırken çıktı token verimliliği eğrisinde de öne çıktı.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.