Ana içeriğe geç
Yapay Zeka

vLLM 0.28.0 sürümü Kimi-K3 ve DeepSeek V4 desteğiyle çıktı

Öne çıkanlar

  • Kimi-K3 optimizasyonları sayesinde ilk belirteç süresi yaklaşık yüzde 60 kısaldı ve GPU başına 17 GiB bellek tasarrufu sağlandı.
  • DeepSeek V4 için uçtan uca seyrek MLA ve AMD Quark NVFP4 desteği sisteme eklendi.
  • Varsayılan en yüksek toplu belirteç sınırı 16 bin 384 seviyesine yükseltildi.
  • Disk tabanlı katmanlı KV önbelleği aktarımı ve Rust tabanlı bağımsız ön yüz özellikleri sunuldu.

Açık kaynaklı büyük dil modeli çıkarım motoru vLLM, 270 katkıcının 584 taahhüdünü içeren v0.28.0 sürümünü yayımladı. Yeni sürüm, Kimi-K3 modeli için kapsamlı performans iyileştirmeleri ve DeepSeek V4 mimarisine yönelik uçtan uca seyrek MLA desteği getiriyor. Ayrıca Model Runner V2 olgunlaştırma çalışmaları ve katmanlı KV önbelleği aktarımı gibi geniş ölçekli dağıtım özellikleri sunuldu.

Güncelleme kapsamında Kimi-K3 için geliştirilen bağlam paralelliği ve birleşik çekirdekler sayesinde ilk belirteç süresinde yüzde 60 civarında hızlanma sağlandı. Paylaşımlı uzman bölümleme desteği GPU başına yaklaşık 17 GiB bellek tasarrufu sunarken, model artık ROCm üzerinde de çalışıyor. DeepSeek V4 tarafında ise AMD Quark NVFP4 desteği ve seyrek top-k çekirdek optimizasyonları sisteme entegre edildi.

Dağıtım mimarisinde disk tabanlı KV önbelleği aktarımı, Rust ön yüzü ve gRPC üzerinden çok modlu çıkarım kabiliyetleri devreye alındı. En yüksek toplu belirteç sınırı 8 bin 192'den 16 bin 384'e çıkarılırken, bitsandbytes desteği çekirdekten çıkarılarak harici eklenti yapısına dönüştürüldü.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.