Opus 5 ile Opus 4.8 yazılım görevlerinde farklı stratejiler izledi
Öne çıkanlar
- Her iki model de 25 görevden 9'unu başarıyla geçerek test skorlarında berabere kaldı.
- Opus 4.8 görevlerin 20'sinde daha küçük yama boyutuyla doğrudan çözüme odaklandı.
- Opus 5 görevlerin 18'inde daha fazla komut ve 15'inde daha fazla test çalıştırdı.
Stet platformu, Opus 5 ve Opus 4.8 modellerini kendi kod tabanındaki 25 farklı görev üzerinde karşılaştırdı. Yapılan testlerde her iki model de 25 görevin 9'unu başarıyla tamamlayarak genel başarı oranında eşit sonuç elde etti. Ancak genel puan eşit olsa da modellerin sonuca ulaşırken izlediği yöntemler ve ürettikleri kod çıktıları belirgin farklılıklar gösterdi.
Opus 4.8 görev sınırlarını dar tuttu ve 25 görevin 20'sinde daha küçük kod değişiklikleriyle doğrudan çözüme odaklandı. Opus 5 ise 18 görevde daha fazla kabuk komutu çalıştırdı, 15 görevde daha fazla test yürüttü ve daha geniş bir arama alanı taradı. Opus 5 özellikle kod tabanında doğru bileşeni bulma ve uçtan uca test yazma konularında daha aktif bir yaklaşım benimsedi.
Maliyet ve süre ölçümlerinde net bir kazanan çıkmadı. Opus 5 genel ortalamada yüzde 1,4 daha düşük maliyet üretirken yüzde 4,3 daha fazla belirteç kullandı ve yüzde 3,7 daha uzun sürede tamamlandı. Değerlendirme, nihai test sonuçlarının tek başına modellerin kod kalitesini, arama stratejisini ve bakım maliyetlerini yansıtmaya yetmediğini ortaya koydu.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.