GPU bellek kapasitesi LLM sunucu performansını tek başına belirlemiyor
Öne çıkanlar
- 23 GB GPU belleğinde 14 GB boş alan varken sunucu saniyede yalnızca 7-8 istek tamamlayabildi.
- A10G kartındaki 483 GB/sn bellek bant genişliği her belirteç üretiminde 19 milisaniyelik sabit taban süresi oluşturdu.
- Eşzamanlı istek sayısı 64 seviyesini aştığında aktarım bant genişliği doygunluğa ulaştı ve kuyruk gecikmeleri arttı.
Yazılımcı Manas Pathak, açık kaynaklı yapay zeka modellerini yerel sunucularda çalıştırma maliyetlerini ve performans sınırlarını test eden bir araştırma yayımladı. Deneyde 8,6 GB ağırlığa sahip Qwen3.5-4B modeli, 23 GB belleğe sahip NVIDIA A10G grafik işlemcisi üzerinde vLLM altyapısıyla çalıştırıldı. Bellekte 14 GB boş alan bulunmasına rağmen sistemin saniyede yalnızca 7 ila 8 istek seviyesinde doygunluğa ulaştığı gözlemlendi.
Araştırma, modelin GPU belleğine sığmasının yüksek trafik kapasitesi anlamına gelmediğini ortaya koydu. Üretim sürecindeki her adımda 8,6 GB'lık model ağırlıklarının bellek bant genişliği üzerinden sürekli aktarılması gerektiği ve A10G'nin 483 GB/sn aktarım hızının belirleyici darboğazı oluşturduğu kaydedildi. Toplu iş boyutu arttıkça verimlilik yükselse de yaklaşık 64 eşzamanlı istek sonrasında bellek aktarım sınırına ulaşıldı ve gecikme sürelerinde ciddi artış yaşandı.
Profil analizleri, GPU üzerinde boşta bekleme süresi bulunmadığını ve çekirdeklerin kesintisiz çalıştığını doğruladı. Pathak, küçük modellerde sınırın bellek kapasitesi olduğunu, ancak model boyutu büyüdükçe temel kısıtın bellek bant genişliğine ve kod çözme hızına kaydığını belirtti.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.