Yapay zeka modellerinin kendi kendini geliştirmesi beklenenden uzun sürebilir
Öne çıkanlar
- Claude Opus 4.8 tabanlı ajanların hazırladığı iki araştırma makalesi NeurIPS standartlarını karşılayamayarak reddedildi.
- Ajanlar mühendislik süreçlerini başarıyla tamamlarken özgün hipotezler ve esnek araştırma yöntemleri geliştirmekte zorlandı.
- Deneylerde ajanlara altı gün süre, sanal bilgisayar erişimi ve 3 bin dolarlık API kredisi ayrıldı.
Princeton Üniversitesi öncülüğündeki bir araştırma ekibi, yapay zeka ajanlarının açık uçlu bilimsel araştırmalar yürütmek için gereken yaratıcılık ve muhakeme yeteneğinden yoksun olduğunu belirledi. Peter Kirgis ve Sayash Kapoor liderliğindeki araştırmacılar, Anthropic'in Claude Opus 4.8 modeliyle çalışan ajanlara NeurIPS 2026 konferansına sunulmuş ancak henüz yayımlanmamış iki makalenin araştırma sorularını verdi. Ajanlar literatür taraması yapıp yüzlerce deney yürüterek mühendislik adımlarını tamamlasa da hazırladıkları iki makale de hakemler tarafından reddedildi.
Araştırma kapsamında ajanlara altı günlük süre, 3 bin dolarlık API kredisi, GPU bütçesi ve sanal bilgisayarlar tahsis edildi. Orijinal makalelerin yazarları tarafından değerlendirilen çalışmalar, alana özgün katkı sunamadığı ve başarısız yaklaşımlardan geri dönülemediği gerekçesiyle yetersiz bulundu. Ajanların yöntemlerini temelden gözden geçirmek yerine iddialarını daralttığı, kaynakları verimli kullanamadığı ve küçük veri kümeleri üzerinde garip deneyler kurguladığı aktarıldı. Öte yandan modellerin sonuçları çarpıtma gibi kural dışı davranışlara başvurmadığı kaydedildi.
Uzmanlar, yapay zekanın dar kapsamlı mühendislik adımlarında başarılı olurken açık uçlu araştırmalarda zorlanmasını pekiştirmeli öğrenme modellerine bağlıyor. Otomatik olarak denetlenemeyen ve açık uçlu düşünme gerektiren görevler için eğitim ortamı oluşturmanın zorluğu vurgulanıyor. Bu bulgular, yapay zekanın insan denetimi olmadan kendi kodunu ve mimarisini hızla geliştireceği yönündeki öngörülerin fazlasıyla iyimser olabileceğini gösteriyor.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.