Ana içeriğe geç
Yapay Zeka

Agents on Rails testinde en iyi yapay zeka modeli yüzde 35 başarı sağladı

Öne çıkanlar

  • Ruby on Rails ekibi, 20 özellik talebinden oluşan ikinci aşama kıyaslama sonuçlarını paylaştı.
  • Lider konumdaki GPT-6 Astra modeli görevleri yüzde 35 başarı oranıyla tamamladı.
  • İlk aşamada yüksek verim sunan GPT-5.6 Luna modeli 60 denemenin hiçbirini bitiremedi.
  • Tüm test setinin işletilme maliyeti yaklaşık 2 bin 250 dolar tuttu.

Ruby on Rails ekibi, yapay zeka modellerinin gerçek dünya yazılım geliştirme yeteneklerini ölçen Agents on Rails kıyaslama çalışmasının ikinci aşamasını yayımladı. 37signals şirketinin Fizzy adlı kanban uygulaması üzerinde hazırlanan 20 kapsamlı özellik talebiyle yürütülen testlerde, en başarılı model görevlerin yalnızca yüzde 35'ini tamamlayabildi. Küçük ölçekli görevlerin yer aldığı ilk aşamada modeller yüzde 92 başarı oranına ulaşırken, belirsiz gereksinimler içeren gerçekçi iş biletleri başarıyı ciddi oranda düşürdü.

Farklı ailelerden 10 modelin katıldığı test sürecinde GPT-6 Astra birinci sırayı aldı. Claude Fable 5.1 ikinci, Gemini 3.8 Flash ise üçüncü sırada yer buldu. Değerlendirmede her çalıştırma için 90 dakika süre, 400 adım ve 60 dolar bütçe sınırı uygulandı. Gemini 3.8 Flash her çalıştırmada ortalama 200 adım atıp 27 dakika harcarken, Astra onda bir oranında daha az adım ve belirgin şekilde düşük token kullanımıyla işleri 9 dakikada bitirdi.

Açık ağırlıklı modellerden Kimi K3 ve GLM 5.3 Flash, 90 dakikalık zaman sınırına sıkça takılarak sırasıyla 14 ve 12 kez zaman aşımına uğradı. İlk aşamada düşük maliyetiyle dikkat çeken GPT-5.6 Luna modeli ise 60 denemenin hiçbirinde başarılı sonuç üretemedi. Ekip, modellerin genel akışı doğru kurgulasa da belirtilmeyen uç durumları ve gizli mühendislik kontrollerini karşılayamadığını açıkladı.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.