Ana içeriğe geç
Donanım

Sekiz adet RTX PRO 6000 yapay zeka sunucusu paralel iş yüklerinde verim sağlıyor

Öne çıkanlar

  • PCIe Gen 5 veri yolu kısıtı nedeniyle 400B+ modeller yerine yüksek eşzamanlı bağımsız iş yükleri öneriliyor.
  • Kart başına 96 GB GDDR7 bellek, 27B modellerde düğüm genelinde 9,2 milyon token KV önbelleği sağlıyor.
  • Sistem, 70B modellerin tam parametreli ince ayarını CPU bellek aktarımıyla tek sunucuda destekliyor.

GPU Partner, sekiz adet NVIDIA RTX PRO 6000 Blackwell grafik kartı ve AMD EPYC 9555 işlemci barındıran sunucu mimarisinin performans analizini yayımladı. Analiz, 768 GB toplam GDDR7 belleğe sahip bu sistemin büyük modelleri PCIe üzerinden bölmek yerine bağımsız tekil GPU örnekleri olarak çalıştırmanın daha verimli olduğunu gösterdi.

İncelemeye göre PCIe Gen 5 veri yolu kısıtlamaları nedeniyle 400 milyar parametre üzeri modellerde yüksek gecikme yaşanıyor. Buna karşın her biri 96 GB belleğe sahip kartlar, Qwen3.8-27B ve Llama-3.3 70B gibi modelleri tek başına barındırabiliyor. Sistem, kart başına düşen yüksek VRAM sayesinde düğüm genelinde 9 milyondan fazla aktif token önbelleği tutabiliyor ve 32 adede kadar mikroservis uç noktasını aynı anda çalıştırabiliyor.

Fine-tuning senaryolarında ise PyTorch FSDP ve DeepSpeed ZeRO-3 gibi çatılar kullanılarak 70 milyar parametreli modeller yerel olarak eğitilebiliyor. Bellek optimizasyonunda AdamW durumlarının AMD EPYC işlemcinin 12 kanallı DDR5 ana belleğine aktarılması, çok düğümlü bulut kümelerine olan ihtiyacı azaltıyor.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.