Ana içeriğe geç
Donanım

Nvidia ve Cerebras yapay zeka çıkarım hızında gerçekçi olmayan rakamlarla yarışıyor

Öne çıkanlar

  • Nvidia ve Cerebras, modellerinde kullanıcı başına saniyede 3 bin 400 token hızına ulaştıklarını açıkladı.
  • SRAM mimarisinin bellek sınırları nedeniyle sistemler uzun girdilerde aynı anda en fazla 12 isteğe yanıt verebiliyor.
  • Şirketler yüksek maliyeti düşürmek için bu hızlandırıcıları standart GPU sistemleriyle bir arada kullanmayı planlıyor.

Nvidia ve Cerebras, Kaliforniya'da düzenlenen Hot Chips konferansında yeni nesil çıkarım hızlarını sergiledi. Nvidia, Groq teknolojisine dayalı LPX sistemlerinin Gemma 4 31B modelinde kullanıcı başına saniyede 3 bin 400 token ürettiğini duyurdu. Cerebras ise CS-4 hızlandırıcılarıyla benzer hızlara ulaştığını açıkladı. Ancak uzmanlar, bu performans rakamlarının yalnızca tekil kullanıcı senaryolarında geçerli olduğunu ve gerçek operasyonel koşulları yansıtmadığını belirtti.

Her iki mimari de yüksek bant genişliği sunan SRAM tabanlı bellek yapıları kullanıyor. Bu tasarım işlem hızını artırırken, bellek kapasitesinin sınırlı kalmasına yol açıyor. Örneğin 100 bin tokenlik uzun bağlam dizilerinde anahtar-değer (KV) önbelleği hızla dolduğu için tek bir LPX veya CS-4 kabini eşzamanlı olarak yalnızca 12 istek işleyebiliyor. Bu durum, hizmet sağlayıcıların modelleri ticari olarak karlı biçimde çalıştırmasını engelliyor.

Sektör analistleri, bu çiplerin tek başına kullanılmak yerine GPU'lar ile eşleştirileceğini aktarıyor. Bu tür hibrit mimarilerde ağır ön işleme yükünü GPU üstlenirken, SRAM çipleri yalnızca kod çözme aşamasında devreye giriyor. Nvidia, AMD ve bulut sağlayıcıları, gecikme süresi ile maliyet dengesini kurabilmek için bu karma donanım yaklaşımına yöneliyor.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.