Magic yapay zeka ön eğitiminde 10 kat verimlilik sağladı
Öne çıkanlar
- Magic, DeepSeek V4 Pro Base başarımını yaklaşık 50 kat daha az FLOP harcayarak yakaladı.
- Yeni yöntem açık ağırlıklı temel modellere kıyasla 10 kattan fazla hesaplama verimliliği sunuyor.
- Modeller denetimli ince ayar olmadan doğrudan pekiştirmeli öğrenmeyle eğitiliyor.
Yapay zeka girişimi Magic, büyük dil modellerinin ön eğitiminde açık ağırlıklı modellere kıyasla 10 kattan fazla hesaplama verimliliği elde ettiğini duyurdu. Şirket, DeepSeek V4 Pro Base modelinin performansını yaklaşık 50 kat daha az işlem gücü kullanarak yakaladığını açıkladı. Geliştirici ekip, yüz bin çiplik devasa altyapılara sahip olmadıkları için modellerin mimarisinde, optimizasyon araçlarında ve veri filtreleme süreçlerinde algoritmik iyileştirmelere odaklandı.
Testlerde farklı tokenizasyon yöntemlerini dengelemek amacıyla ayrılmış veri kümeleri üzerinde bayt başına düşen bit kaybı ölçüldü. Şirket, GB200 ve GB300 donanımlarında vLLM ile SGLang çıkarım motorlarını kullanarak DeepSeek, Moonshot ve NVIDIA tarafından yayımlanan temel modelleri kıyasladı. Yaklaşık 4 milyon dolarlık ön eğitim bütçesiyle ölçeklenen yeni modelin, açık ağırlıklı tüm temel modelleri karmaşıklık testlerinde geride bıraktığı belirtildi.
Ekip, kodlama ve otonom yapay zeka araştırmaları geliştirmek için uzun bağlam pencereleri ile takviyeli öğrenmeyi temel modelin üzerine doğrudan uyguluyor. Modellerin denetimli ince ayar ya da damıtma adımları olmadan doğrudan pekiştirmeli öğrenmeyle eğitildiği bildirildi. Şirket bir sonraki aşamada uzun vadeli pekiştirmeli öğrenme tekniklerini ve güvenlik uyum yöntemlerini trilyon parametreli modellere taşımayı hedefliyor.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.