Ana içeriğe geç
Yapay Zeka

DeepSeek yeni çok modlu yapay zeka modeli DeepSeek-V4.1-Flash modelini duyurdu

Öne çıkanlar

  • 552 milyar parametreli model 1 milyon tokenlik bağlam penceresini destekliyor.
  • Token başına düşen küresel KV önbellek boyutu 890 bayta kadar indirildi.
  • Model ağırlıkları ve kod tabanı MIT lisansı altında açık kaynak olarak yayımlandı.

DeepSeek, 552 milyar toplam parametreye ve 1 milyon token bağlam penceresine sahip yeni çok modlu modeli DeepSeek-V4.1-Flash modelini tanıttı. Causal Encoder-Decoder mimarisiyle geliştirilen sistem, metin ve görsel girdileri yerel olarak işleyerek çıkarım maliyetlerini düşürmeyi hedefliyor. Model, ön doldurma aşamasında token başına 8 milyar, üretim aşamasında ise 16 milyar parametre aktif ederek yoğun girdili ajan iş yüklerinde yüksek verimlilik sunuyor.

Modelin bellek tüketimini azaltmak amacıyla Compressed Sparse Attention 2 ve FP4 formatında anahtarlama-değer önbellekleme teknikleri devreye alındı. Bu mimari tercihler sayesinde küresel KV önbellek boyutu token başına 890 bayta kadar gerileyerek önceki nesle kıyasla yaklaşık 4 kat tasarruf sağladı. Şirket, 45 trilyon tokenlık çok modlu veri kümesi üzerinde sıfırdan eğitilen modelin 1 ile 100 arasında ayarlanabilir bir akıl yürütme çabası parametresi içerdiğini belirtti.

Yayımlanan performans testlerine göre model, DeepSWE v1.1 yazılım mühendisliği kıyaslamasında yüzde 74,2 çözüme ulaşarak önde gelen kapalı kaynaklı rakiplerle başa baş konuma geldi. Şirket ayrıca prompt kodlama süreçlerini standartlaştırmak amacıyla Rust tabanlı deepseek-recipe kütüphanesini paylaştı. Model ağırlıkları ve ilgili kod tabanı topluluğa MIT lisansı altında açık kaynak olarak sunuldu.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.