Yapay zeka modelleri Brood War testinde acemi seviyesini aşamadı
Öne çıkanlar
- Codex Astra 'xhigh' yapılandırması, 18 karşılaşmanın tamamını kazanarak testi zirvede tamamladı.
- Grok 4.6 modelleri uzun akıl yürütme sürelerine karşın çok az sayıda komut üretebildi.
- Test edilen modellerin hiçbiri temel taktiklerin ve başlangıç seviyesinin ötesine geçemedi.
Geliştirici Swerdlow, büyük dil modellerinin gerçek zamanlı strateji oyunu StarCraft: Brood War üzerindeki performansını ölçen Brood War Bench testini yayımladı. Freestyle sanal makineleri üzerinde lig usulü gerçekleştirilen karşılaşmalarda Codex, Claude ve Grok ailelerine ait modeller farklı çaba seviyelerinde birbirleriyle yarıştı. Test sonuçlarına göre hiçbir model oyunu başlangıç seviyesinin ötesinde oynayamadı; ancak Codex Astra 'xhigh' yapılandırması 18 galibiyet ve 0 mağlubiyet alarak liderliğe yerleşti.
Test sürecinde modellerin gerçek zamanlı dinamiklere uyum sağlamakta zorlandığı ve karar sürecini sıra tabanlı bir oyun gibi ele aldığı gözlemlendi. Düşünme süresi uzayan modeller bu esnada haritada pasif kalarak yenilgiye uğradı. Codex modelleri genellikle erken taciz stratejilerine ve ayrık alt ajan kullanımına başvururken, Grok 4.6 uzun akıl yürütme sürelerine rağmen oyuna neredeyse hiçbir komut iletemedi. Claude Fable ise ekonomi kurma ve teknoloji ağacında ilerleme konusunda en tutarlı gayreti gösteren model oldu.
Genel sıralamada Codex Astra modelleri yüksek galibiyet oranlarıyla ilk sıraları toplarken Claude Opus 5 ve Sol modelleri orta sıralarda yer aldı. Test organizatörü, modellerin karmaşık ordular kuramadığını ve basit taktiklere karşı savunmasız kaldığını, ancak bu kıyaslama çalışmasının otonom ajanların stratejik gelişimi için önemli bir zemin sunduğunu belirtti.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.