OpenAI GPT-6 Astra modeli ARC-AGI-3 testinde insan performansını geçti
Öne çıkanlar
- GPT-6 Astra, Provider Adapter altyapısıyla ARC-AGI-3 Semi-Private testinde yüzde 99,9 başarı oranına ulaştı.
- Model, test edilen seviyelerin yüzde 96'sında insan medyanından daha az eylem kullandı ve ortalama yüzde 51,7 daha az adım attı.
- Astra, mekanikleri yönetmek için ortama özel cebirsel kısaltmalar ve amaca yönelik Python yazılım araçları geliştirdi.
ARC Prize ekibi, OpenAI'ın GPT-6 Astra modelinin genel yapay zeka ölçüm testi ARC-AGI-3 üzerindeki performans sonuçlarını yayımladı. Model, Standard test düzeneğinde yüzde 62,7 başarı elde ederken tescilli muhakeme durumunu koruyan Provider Adapter altyapısında yüzde 99,9 skora ulaştı. Astra, görevleri tamamlarken harcadığı adım sayısı açısından insan medyanını aşarak yüzde 96'lık bir bölümde insanlardan daha az eylem gerçekleştirdi.
Araştırmacılar, modelin daha önce karşılaşmadığı soyut oyun mekaniklerini çözerken kompakt bir sembolik dünya modeli kurguladığını aktardı. Astra, ortam durumlarını ve çok adımlı eylem planlarını takip etmek amacıyla kendi alanına özgü cebirsel notasyonlar üretti. İleri düzey korumalı alan testlerinde ise labirent çözücü, devriye takipçisi ve muharebe kuralları gibi görev odaklı Python kütüphaneleri yazarak dış araçlardan yararlandı.
ARC Prize yöneticileri, bu sonuçların belirgin bir sıçrama olduğunu ancak kapalı ve deterministik test ortamları nedeniyle AGI kanıtı sayılmayacağını bildirdi. Kuruluş, modellerin bağlam yönetimi yeteneklerini daha iyi kıyaslamak için liderlik tablosunda hem standart hem de sağlayıcıya özel test sonuçlarını listeleyeceğini duyurdu. Araştırma ekibi, bir sonraki nesil testlerde yinelemeli öz-geliştirme ve açık uçlu yenilikçiliği ölçecek.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.