DeepSeek yeni modeliyle KV Cache sıkıştırmasında sınırları zorluyor
Öne çıkanlar
- Causal Encoder-Decoder yapısı önyüklemede 8 milyar, üretimde 16 milyar parametre etkinleştiriyor.
- CSA2 mekanizması ve FP4 kullanımıyla çalışma anı KV önbellek gereksinimi 4 kat azaldı.
- Model, 1 milyon belirteçlik bağlam uzunluğunu ve 552 milyar toplam parametreyi destekliyor.
DeepSeek ekibi, uzun bağlamlı yapay zeka aracı iş yüklerindeki bellek darboğazını çözmeyi hedefleyen çok modlu mimariye sahip DeepSeek-V4.1 Flash modelini tanıttı. Model, 552 milyar toplam parametre boyutu ve 1 milyon belirteçlik bağlam desteğiyle geliştirildi. Araştırmacılar, YoCo mimarisinden esinlenen Causal Encoder-Decoder (CED) yaklaşımını kullanarak önyükleme (prefill) aşamasındaki hesaplama maliyetini düşürdü. Yapılandırma sayesinde 40 katmanlı omurganın ilk 20 katmanı kodlayıcı, son 20 katmanı ise kod çözücü olarak görev yapıyor.
Model mimarisi, belirteç başına önyükleme sürecinde yalnızca 8 milyar, üretim (decode) sürecinde ise 16 milyar parametre etkinleştiriyor. Çalışma kapsamında geliştirilen CSA2 mekanizması; kanal, dizi ve katman boyutlarında önbellek sıkıştırması uyguluyor. Encoder katmanında iki ardışık pozisyon tek bir önbellek girdisinde birleştirilirken, katmanlar arası küresel KV paylaşımı ve FP4 kuantizasyonu bir arada çalışıyor. Bu yöntemler, modelin çalışma anındaki KV önbellek depolama ihtiyacını DeepSeek-V4 Flash modeline kıyasla dörtte bir oranına indiriyor.
Çok modlu mimaride 32 katmanlı DeepSeek-ViT kullanan model, görsel özellikleri metin omurgasına aktarmadan önce dokuz kat uzamsal alt örnekleme uyguluyor ve görsel belirteç sayısını tek bir görsel için azami 1024 ile sınırlıyor. Karışık uzmanlar (MoE) katmanlarında metin ve görsel belirteçleri için ayrı düzeltme sapmaları işletilerek yük dengesi sağlanıyor. Sistem ayrıca spekülatif kod çözme desteği sunan DSpark blokları ve n-gram tabanlı Engram belleğiyle destekleniyor.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.