Specific şirketi kurumsal kod tabanlarını içeren Real-SWE kıyaslama testini duyurdu
Öne çıkanlar
- Fable 5.1, yüzde 38,8 başarı oranıyla test edilen sekiz model arasında ilk sırada yer aldı.
- İncelenen 10 görevden 6'sında yapay zeka modellerinin başarı oranı yüzde 15'in altında kaldı.
- Modellerin 10 dakikadan kısa süren çalıştırmalarının yüzde 71,4'ü başarısızlıkla sonuçlandı.
- Görev başına maliyetler 2,50 dolar ile 6,96 dolar aralığında gerçekleşti.
Specific, yapay zeka modellerinin kurumsal üretim kod tabanlarındaki yazılım mühendisliği performansını ölçen Real-SWE adlı yeni kıyaslama platformunu kullanıma sundu. Gerçek şirketlerden lisanslanan kapalı kaynak kod depoları üzerinden oluşturulan test paketi, açık internette yer almayan ve iş süreçlerine doğrudan etki eden karmaşık görevleri içeriyor. Değerlendirme sürecinde modeller, sadece kod satırlarıyla değil; veritabanları, altyapı araçları ve şirket içi iş akışlarıyla birlikte çalışan yerel araç ortamlarında denendi.
Yayımlanan ilk sonuçlara göre lider konumdaki Fable 5.1 modeli görevlerin yalnızca yüzde 38,8'ini çözüme ulaştırdı. İkinci sırada yüzde 33,8 başarı oranıyla GPT-6 Astra yer alırken, Gemini 3.8 Flash yüzde 31,2 ile üçüncü oldu. İncelenen örnek görevlerin 10 tanesinden 6'sında modellerin başarı oranı yüzde 15'in altında kaldı. Süre analizleri ise 10 dakikadan kısa süren denemelerin yüzde 71,4'ünün, daha uzun süren denemelerin ise yüzde 73,4'ünün başarısızlıkla sonuçlandığını ortaya koydu.
Araştırma verileri, mevcut dil modellerinin şirketlere özgü kodlama kalıplarını ve gereksinimleri anlamakta yetersiz kaldığını gösterdi. Görev başına maliyetlerin 2,50 dolar ile 6,96 dolar arasında değiştiği test ortamında en düşük maliyeti Gemini 3.8 Flash, en yüksek maliyeti ise Fable 5.1 sundu. Geliştirici ekip, modellerin kapalı devre kurumsal yazılım geliştirme standartlarını karşılamaktan henüz uzak olduğunu bildirdi.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.