Cerebras yapay zeka modellerindeki sıkıştırma ve kuantizasyon politikasını açıkladı
Öne çıkanlar
- Cerebras, genel API uç noktalarında modellerin budanmamış orijinal sürümlerini sunuyor.
- Aktivasyonlar, dikkat katmanları ve KV önbelleği kuantize edilmeden tam duyarlılıkta tutuluyor.
- Hassas katmanlar işlemler sırasında anlık ters kuantizasyon ile tam duyarlılıkta çalıştırılıyor.
Çip ve yapay zeka altyapı sağlayıcısı Cerebras, platformunda barındırdığı açık kaynaklı yapay zeka modellerinin mimari bütünlüğü ve sıkıştırma yöntemleri hakkında teknik detayları paylaştı. Şirket, genel erişime açık uç noktalarında budanmış model sunmadığını ve yalnızca orijinal, eksiksiz modelleri işlettiğini duyurdu. Araştırma amaçlı geliştirilen budanmış modellerin ise üretim API'si yerine Hugging Face üzerinde toplulukla paylaşıldığı kaydedildi.
Şirket, model kalitesini korumak adına yalnızca depolama sırasında seçici ağırlık kuantizasyonu uyguladığını bildirdi. Ağırlıkların 16-bit, 8-bit veya 4-bit formatlarında saklandığı, ancak hassas katmanların tam duyarlılıkta tutulduğu aktarıldı. Gerçek zamanlı ters kuantizasyon sayesinde işlemlerin yüksek duyarlılıkta yürütüldüğü, aktivasyonlar, dikkat mekanizmaları ve KV önbelleğinin tam duyarlılıkta kuantize edilmeden korunduğu belirtildi.
Cerebras, mevcut modellerin mimarilerini haber vermeden değiştirmeyeceğini taahhüt etti. Gelecekte ek sıkıştırma veya budama teknikleri sunulması durumunda, bu modellerin şeffaflık adına ayrı isimlerle farklı uç noktalarda açılacağı vurgulandı. Böylece geliştiricilerin ihtiyaçlarına en uygun hassasiyet ve performans dengesini açıkça seçebileceği açıklandı.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.