Ana içeriğe geç
Yapay Zeka

GPT-5.6 Luna kod incelemesinde maliyeti düşürürken güvenlikte zayıf kaldı

Öne çıkanlar

  • GPT-5.6 Luna, GPT-6 Astra'ya göre 28 kat daha ucuza çalıştı ve 69 doğrulanmış hata buldu.
  • Astra güvenlik odaklı 24 hatanın 19'unu yakalarken, Luna bu kategoride yalnızca 9 hata tespit etti.
  • Luna'nın bildirdiği her dört hatadan biri yanlış çıkarken, Astra yüzde 96 kesinlik oranı yakaladı.

Entelligence ekibi, kod inceleme süreçlerinde düşük maliyetli GPT-5.6 Luna ile üst düzey GPT-6 Astra modellerini 50 açık kaynak çekme isteği üzerinde karşılaştırdı. Yapılan testlerde Luna inceleme başına 0,0041 dolar, Astra ise 0,113 dolar harcadı ve iki model arasında 28 kat maliyet farkı oluştu. Luna 50 çekme isteğinde 69 doğrulanmış hata tespit ederken, Astra 92 doğrulanmış hata yakaladı. Tüm test sürecinde Luna toplam 0,20 dolar, Astra ise 5,66 dolar maliyet çıkardı.

Modellerin doğruluk ve hassasiyet oranlarında belirgin bir ayrışma görüldü. Luna modelinin öne sürdüğü 93 tespitten 24'ü doğrulama aşamasında elendi ve model yüzde 74 kesinlik oranında kaldı. Astra ise 96 tespitin 92'sini doğrulatarak yüzde 96 kesinliğe ulaştı. Luna genel veri ve mantık hatalarında Astra'ya yaklaşırken, özellikle kimlik doğrulama ve yetkilendirme kodlarında yetersiz kaldı. Güvenlik kategorisindeki 24 hatanın sadece 9'unu Luna yakalayabilirken, Astra bu grupta 19 hatayı ortaya çıkardı.

Araştırma sonuçları, düşük maliyetli modellerin rutin mantık denetimlerinde etkili olduğunu ancak güvenlik kritik alanlarda tek başlarına yetersiz kaldığını gösterdi. İki modelin birlikte çalıştırıldığı senaryoda ise toplam 143 doğrulanmış hatanın 117'si 5,86 dolara tespit edildi. Entelligence, kodun niteliğini ayırt ederek kritik incelemeleri gelişmiş modellere, rutin işleri ise ucuz modellere aktaran yönlendirme mimarilerini önerdi.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.