Ana içeriğe geç
Yapay Zeka

Geliştirici 998 dolarlık bütçeyle 3,8 milyar parametreli yapay zeka modeli eğitti

Öne çıkanlar

  • 3,8 milyar parametreli dil modeli, sekiz adet kiralık Nvidia B200 üzerinde 43 saatte ve 998 dolara eğitildi.
  • Model, 65,3 milyar belirteçlik eğitimin ardından CORE değerlendirme testinde 0,384 skoruna ulaştı.
  • Bağlam uzunluğunu 2048'e çıkarmak, uzun istemli görevlerdeki performans kaybını engelleyerek genel skoru artırdı.

Geliştirici Hugo Vergnes, kiralık Nvidia B200 donanımları üzerinde 998 dolar harcayarak 3,8 milyar parametreli bir büyük dil modeli eğittiğini açıkladı. Proje kapsamında geliştirilen model, 65,3 milyar belirteç (token) üzerinde 43 saatte eğitildi ve CORE değerlendirme testinde 0,384 puanına ulaştı. Bu skor, OpenAI'ın 1,5 milyar parametreli GPT-2 modelinin aldığı 0,2565 seviyesinin belirgin şekilde üzerinde yer aldı.

Eğitim sürecinde FP8 duyarlılığı, kelime dağarcığı dolgulama, ClimbMix veri kümesi ve matris parametreleri için Muon eniyileyicisi kullanıldı. Bellek verimliliğini artırmak amacıyla Liger kütüphanesinin birleştirilmiş çapraz entropi kaybından ve kapısız relu² çok katmanlı algılayıcı yapısından yararlanıldı. Model mimarisine eklenen değer gömmeleri (value embeddings) ise eğitim işlem gücünü düşürmeden CORE puanına yüzde 3,2 katkı sağladı.

Bağlam uzunluğunun 1024'ten 2048'e çıkarılması, SQuAD ve boolq gibi uzun istem gerektiren görevlerdeki kesintileri önleyerek toplam test skorunu 0,3384'ten 0,3840'a yükseltti. Araştırma, yüksek bütçeli laboratuvarlara ihtiyaç duyulmadan bireysel mühendislerin kısıtlı bütçelerle rekabetçi dil modelleri geliştirebileceğini somut verilerle ortaya koydu.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.