Ana içeriğe geç
Yapay Zeka

Geliştirici GPU bağımlılığını azaltan özel dil modeli eğitti

Öne çıkanlar

  • Yeni model 43 bin 208 tokenlik özel sözlük ve 64 tokenlik bağlam penceresi kullanıyor.
  • Model tek bir CPU çekirdeğinde 4 milisaniyede çıkarım yapabiliyor.
  • Ön eğitim aşaması filtrelenmiş TinyStories verisiyle yarım saatten kısa sürdü.

Yazılımcı Joe Cooper, haiku şiiri yazma uygulaması için GPU ihtiyacını ortadan kaldıran amaca özel küçük bir dil modelini sıfırdan eğittiğini duyurdu. Cooper, başlangıçta 1,7 milyar parametreli SmolLM2 modelini ince ayarla kullanırken sistemin sürekli GPU kaynağı tüketmesi ve genel amaçlı kelime dağarcığının hece tablosuyla tam uyuşmaması üzerine yeni bir mimariye geçti.

JAX çatısı kullanılarak geliştirilen yeni model, 43 bin 208 tokenlik özel bir kelime dağarcığına ve 64 tokenlik bağlam penceresine sahip. Cooper, ön eğitim sürecinde filtrelenmiş TinyStories veri kümesindeki 195 milyon tokeni ve ardından Haiku 333K veri kümesini kullanarak modeli 6 katmanlı ve 256 gömme boyutlu kompakt bir yapıda eğitti.

Uygulanan yöntem sayesinde sistem tek çekirdekli bir AMD 5900X işlemci üzerinde 4 milisaniyede tahmin üretebilir hale geldi. Yeni mimari, genel amaçlı büyük modellerin aşırı kaynak kullanımını önlerken belirli kurallara bağlı metin üretim görevlerinin doğrudan CPU üzerinde çalıştırılabileceğini gösterdi.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.