vLLM, AMD GPU'larda spekülatif kod çözme desteğini test etti
Öne çıkanlar
- vLLM, AMD Instinct MI300X ve MI355X donanımlarında spekülatif kod çözme performansını değerlendirdi.
- Sistemde yerel MTP, Gemma 4 MTP, EAGLE-3, DFlash ve DSpark olmak üzere beş taslak yöntemi karşılaştırıldı.
- DFlash paralel blok üretimi sağlarken, DSpark bu yaklaşıma sıralı Markov düzeltmesi ekliyor.
Açık kaynaklı model sunum motoru vLLM, AMD Instinct MI300X ve MI355X grafik işlem birimleri üzerinde spekülatif kod çözme (speculative decoding) yöntemlerini test etti. Paylaşılan teknik inceleme, büyük dil modellerinin standart ardışık üretim hızını artırmak amacıyla uygulanan taslak ve doğrulama süreçlerini ele alıyor. Yapılan ölçümlerde, doğrulanan taslak belirteçlerin tek bir ana model geçişiyle onaylanmasının verimlilik üzerindeki etkileri incelendi.
İncelemede yerel MTP, Gemma 4 MTP, EAGLE-3, DFlash ve DSpark olmak üzere beş farklı taslak çıkarma yaklaşımı karşılaştırıldı. Yerel MTP ve EAGLE-3 gibi yöntemler belirteçleri sıralı olarak üretirken, DFlash tüm aday belirteç bloğunu tek bir ileri geçişte paralel olarak tahmin ediyor. DSpark ise paralel tahmin mekanizmasını hafif bir Markov katmanıyla destekleyerek blok içi belirteç uyumunu artırıyor.
Testler, açık kaynaklı ROCm yazılım platformu kullanılarak donanım düzeyinde yürütüldü. vLLM mühendisleri, spekülatif kod çözmenin çıktı başarımının seçilen taslak yöntemine, öneri uzunluğuna, kontrol noktasına ve iş yükünün kabul oranına doğrudan bağlı olduğunu bildirdi. İlgili konfigürasyonlar, sistem parametreleri üzerinden tanımlanabiliyor.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.