GLM-5.3 gerçek dünya yapay zeka testlerinde rakiplerini geride bıraktı
Öne çıkanlar
- GLM-5.3, 5 farklı kategorideki tüm görevleri yüzde 100 başarıyla tamamlayan tek model oldu.
- Model, tüm test paketini GPT-5.5'in beşte biri maliyetle 0,28 dolara bitirdi.
- Anthropic modelleri güvenlik filtreleri nedeniyle 4 kodlama görevini başlamadan reddetti.
- GPT-5.6 serisi jailbreak ve güvenlik testlerinin çoğunda başarısız oldu.
Reinvently tarafından yayımlanan Ed-o-meter kıyaslama testi sonuçlarına göre açık ağırlıklı GLM-5.3 modeli; kodlama, veri, gerçek dünya senaryoları, güvenlik ve araç kullanımı alanlarındaki 28 görevin tamamını yüzde 100 başarıyla tamamladı. Model, GPT-5.5 ve Claude serisi gibi kapalı kaynaklı alternatifleri geride bırakırken, tüm test paketini 0,28 dolarlık maliyetle bitirerek en yakın rakiplerinin beşte biri fiyatına ulaştı.
Test protokolü, modelleri teorik akademik ölçütler yerine birim test mantığıyla kurgulanan pratik iş senaryoları üzerinden değerlendiriyor. GLM-5.3 genel görev başarısı ve güvenlik testlerinde en yüksek skoru elde ederken, 16,3 saniyelik ilk belirteç yanıt süresiyle GPT-5.5'in (13,2 saniye) gerisinde kaldı. Kimi-k3 modeli 9,5 ile en yüksek yanıt kalitesi puanını alsa da veri işleme adımlarındaki hataları ve yüksek gecikme süresi nedeniyle geriye düştü.
Değerlendirmede Anthropic modellerinin bazı zararsız kodlama görevlerini güvenlik sınıflandırıcısı nedeniyle doğrudan reddettiği, OpenAI'ın GPT-5.6 serisinin ise güvenlik testlerinde jailbreak açıklarına karşı düşük direnç gösterdiği kaydedildi. Düşük maliyetli seçenekler arasında GPT-5.6-luna görev başına 0,0023 dolar ile öne çıkarken, güvenlik zaafları nedeniyle yalnızca düşük riskli arka plan işleri için önerildi.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.