Ana içeriğe geç
Yapay Zeka

Qwen3.8 27B testleri 4 bit nicelemenin kaliteyi koruduğunu gösterdi

Öne çıkanlar

  • Qwen3.8 27B modelinin 4 bit Q4_K_M sürümü, 17 GB bellek kullanımıyla tam model kalitesini korudu.
  • Model, Terminal-Bench 2.1 ve IFBench testlerinde tam sürüm BF16 sonuçlarıyla aynı başarıyı verdi.
  • 1 bit nicelenmiş modellerde performans rastgele tahmin seviyesine gerileyerek çöktü.

Quesma tarafından yayımlanan kapsamlı test sonuçları, Qwen3.8 27B modelinin 4 bit sürümlerinin tam model performansını neredeyse kayıpsız koruduğunu gösterdi. Orijinal BF16 ağırlıklarıyla 55 GB yer kaplayan model, 4 bit Q4_K_M sürümünde 17 GB seviyesine indi ve tüketici sınıfı 24 GB bellekli grafik kartlarında 64 bin token bağlam alanı bırakarak çalıştı. Testlerde 4 bit model, Terminal-Bench 2.1 yazılım geliştirme ölçütünde ve GPQA Diamond testlerinde tam modelle aynı başarıyı sergiledi.

Araştırmacı, testleri llama.cpp ve Unsloth modelleri üzerinde Modal bulut altyapısını kullanarak yürüttü. Elde edilen bulgulara göre 2 bit UD-Q2_K_XL sürümünde hafif bir performans düşüşü gözlense de model işlevselliğini sürdürdü. Ancak 1 bit seviyesine inildiğinde model yeteneklerinde sert bir çöküş yaşandı ve GPQA Diamond testinde rastgele tahmin seviyesine geriledi.

Sonuçlar, yerel büyük dil modeli çalıştıran kullanıcılar için 4 bit nicelemenin kalite kaybı yaşatmadan bellek gereksinimlerini üçte bire düşürdüğünü ortaya koydu. Uzun akıl yürütme adımlarının 1 bitlik modellerde token bütçesini tüketerek performansı daha da kötüleştirdiği saptandı.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.