Ana içeriğe geç
Yapay Zeka

Yerel yapay zeka modelleri donanım ve yazılım farklılıkları yüzünden sapma gösteriyor

Öne çıkanlar

  • Farklı dikkat motorları uzun bağlamlarda en yüksek skorlu token seçimlerini değiştirdi.
  • KV önbelleğinin INT4 formatına sıkıştırılması araç çağırma işlemlerinde kalıcı hatalara yol açtı.
  • Kuantizasyon yöntemleri farklı CUDA çekirdekleri çalıştırarak referans çıktılardan saptı.

Level1Techs forumunda yayımlanan teknik bir analiz, yerel donanımlarda çalıştırılan büyük dil modellerinin referans testlere kıyasla neden daha düşük performans gösterdiğini inceledi. Araştırmacı, Qwen3.6-27B modeli üzerinde gerçekleştirdiği deneylerde, kullanılan dikkat arka uçları, anahtar-değer (KV) önbelleği sıkıştırması ve ağırlık kuantizasyonlarının modelin çıktı olasılıklarını doğrudan değiştirdiğini ortaya koydu.

Deney sonuçlarına göre FlashAttention 2, Flash Inference ve Triton Attention gibi farklı CUDA çekirdekleri, matris çarpımı seviyesinde hesaplama farklılıklarına yol açtı. Özellikle uzun bağlamlı ve araç çağırma içeren 100 bin tokenlik gerçek iş yüklerinde, KV önbelleği INT4 seviyesine sıkıştırıldığında modelin araç çağırma zincirlerini tamamen bozduğu ve hata ürettiği saptandı.

Farklı kuantizasyon biçimlerinin (FP8, INT8, NVFP4 ve AWQ) ayrı GEMM çekirdekleri tetiklediği kaydedildi. Bu durumun, aynı ağırlıklar kullanılsa dahi kullanıcıların referans sistemlerden farklı sonuçlar almasına yol açtığı belirtildi.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.