Qwen ekibi yeni mimarili Qwen3.8 Flash Next modelini duyurdu
Öne çıkanlar
- Qwen3.8-Flash-Next, toplam 125 milyar parametrenin yalnızca 6 milyarını aktif olarak işliyor.
- Model, 262 bin 144 belirteçlik yerel bağlam uzunluğunu destekliyor.
- Unsloth, modelin dinamik kuantizasyonlu GGUF sürümlerini Hugging Face üzerinde paylaştı.
Qwen araştırma ekibi, gelecek nesil Qwen4 modellerinin mimari temelini oluşturan Qwen3.8-Flash-Next modelini yayımladı. Açık ağırlıklı olarak sunulan ve Unsloth tarafından GGUF formatına dönüştürülen deneysel model, büyük dil modellerinde ölçeklenebilirlik ile işlem verimliliğini artırmayı hedefleyen yenilikçi bir yapı sunuyor.
Yeni mimari, blok düzeyinde çalışan Qwen Sparse Attention (QSA) ve Gated DeltaNet tabanlı melez bir dikkat mekanizması içeriyor. Toplam 125 milyar parametreye sahip olan sistem, her adımda yalnızca 6 milyar parametreyi aktif hale getiriyor. Modelde ayrıca bellek kısıtlı donanımlar için 51 milyar parametrelik n-gram gömme (embedding) katmanı ile 262 bin 144 belirteçlik yerel bağlam penceresi desteği bulunuyor.
Eğitim sürecinde Muon ve AdamW optimize edicilerini bir arada kullanan ekip, geleneksel yığın ısıtma adımlarını kaldırarak daha az adımda yakınsama elde etti. Model; Transformers, llama.cpp, vLLM, SGLang ve Ollama gibi yaygın araçlar üzerinden yerel veya sunucu ortamlarında çalıştırılabiliyor.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.