Nvidia, Groq 3 sisteminin hızını ilk kez gösterdi
Öne çıkanlar
- LPX sistemi, Gemma 4 31B modelinde 3.400 token/s hızına ulaştı.
- Bir LPX rafı 256 LPU ve toplam 128 GB SRAM barındırıyor.
- DeepSeek V3 için yaklaşık 1.342 LPU ve 5’ten fazla raf gerekiyor.
- Nebius, LPX sistemlerini veri merkezlerinde kullanacak ilk müşteriler arasında yer alıyor.
Nvidia, 20 milyar dolarlık Groq yatırımı kapsamında geliştirdiği Groq 3 tabanlı LPX raf sistemlerinin performansını 24 Ağustos 2026'da ilk kez açıkladı. Artificial Analysis tarafından yapılan bağımsız testte sistem, Google’ın Gemma 4 31B modelinde 100 bin tokenlık girişle saniyede 3.400 token üretti. Nvidia, bu sonucun aynı koşullarda 882 token/s hızına ulaşan Cerebras sisteminden 4 kat yüksek olduğunu belirtti.
Groq 3 LPU’ları, çıkarım işlemleri için tasarlanan ve yüksek miktarda SRAM kullanan veri akış mimarisine dayanıyor. Her LPU’da 500 MB SRAM bulunuyor. Bir LPX rafı, Ethernet üzerinden 256 LPU’yu birleştirerek toplam 128 GB yüksek bant genişlikli bellek sunuyor. Gemma 4 31B modeli, FP8 biçiminde çalıştırıldığında yaklaşık 31 GB bellek gerektirdiği için tek bir raf içine sığıyor. Daha büyük modeller ise çok sayıda raf ve hızlandırıcı gerektiriyor. Örneğin DeepSeek V3’ü çalıştırmak için yaklaşık 1.342 LPU, yani 5’ten fazla LPX rafı gerekiyor.
Test, Gemma 4 31B’nin yoğun ve görece küçük bir model olması nedeniyle LPX için elverişli bir senaryoyu gösteriyor. Nvidia’nın asıl hedefi, GPU’ların istemleri işlediği ön doldurma aşamasını, LPU’ların ise bellek bant genişliği gerektiren çözümleme aşamasını yürüttüğü karma mimaride daha yüksek toplam performans sağlamak. Nvidia, Nebius’un bu sistemleri veri merkezlerinde kullanacak ilk müşteriler arasında yer alacağını açıkladı. Cerebras ise daha yüksek kapasite sunan CS-4 sistemlerini ve GPU ile WSE hızlandırıcılarını birleştiren yapılarını 2026’nın ilerleyen dönemlerinde kullanıma açacak.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.