OpenAI GPT-6 Astra ile döngüsel transformer mimarisi gündeme geldi
Öne çıkanlar
- GPT-6 Astra, ARC-AGI-3 mantık testinde yüzde 99,9 başarı oranına ulaştı.
- Döngüsel mimari, ağırlıkları yeniden kullanarak parametre sayısını artırmadan katman derinliğini yükseltiyor.
- Ağırlık paylaşımı parametre belleğini azaltsa da hesaplama ve KV önbellek maliyetini düşürmüyor.
OpenAI'ın yeni yapay zeka modeli GPT-6 Astra, özellikle kodlama, matematik ve bilgisayar arayüzü kullanımı alanlarındaki performansıyla kullanıma sunuldu. Modelin grafik işleme, üç boyutlu modelleme ve işletim sistemi üzerindeki fare ile klavye hareketlerini kontrol etme yetenekleri öne çıkıyor. Bağımsız kıyaslama testlerinde selefi GPT-5.6 Sol modelini geride bırakan Astra, ARC-AGI-3 mantık testinde yüzde 99,9 başarı oranına ulaştı.
Modelin mimari yapısında "döngüsel transformer" (looped transformer) ve tekrarlayan derinlik yaklaşımlarının kullanıldığına dair teknik raporlar tartışılıyor. Bu yöntem, modeldeki gizli katman temsillerinin aynı transformer bloklarından ağırlıkları değiştirmeden birden fazla kez geçirilmesi prensibine dayanıyor. Böylece parametre sayısı artırılmadan modelin etkin işlem derinliği ikiye katlanabiliyor veya dinamik biçimde ölçeklenebiliyor.
Nanbeige4.2-3B ve Ouro gibi açık modellerde de görülen bu mimari, parametre belleğinde tasarruf sağlarken hesaplama yükünü ve dikkat mekanizmasının bellek ihtiyacını hafifletmiyor. Kendi içinde ağırlık paylaşımı yapan döngüsel yapılar, her geçişte farklı gizli durumlar ürettiği için bağımsız anahtar-değer (KV) önbelleği tutulmasını gerektiriyor. Geliştiriciler bu sistemleri jeton başına yönlendirilen esnek döngü mekanizmalarıyla optimize etmeye devam ediyor.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.