Ana içeriğe geç
Yapay Zeka

Jane Street dil modellerinde veri ağırlıklandırmanın ölçeklenme yasalarını inceledi

Öne çıkanlar

  • Dizilere atanan eğitim ağırlıklarının kaybı azaltma etkisi küçükten büyüğe önce yükseldi ardından tekrar düştü.
  • Orta ölçekli modeller ağırlıklı verilere en yüksek duyarlılığı gösterirken büyük modeller tüm veriyi eşit oranda öğrendi.
  • Eğitim dönemi sayısının artırılması, modellerin veri ağırlığına en duyarlı olduğu tepe noktasını daha küçük ölçeklere kaydırdı.

Finans ve teknoloji şirketi Jane Street, büyük dil modellerinin eğitiminde kullanılan veri ağırlıklandırma yöntemlerinin farklı model ölçeklerindeki etkilerini araştıran yeni bir çalışma yayımladı. Şirket bünyesindeki araştırmacılar, eğitim sırasında dizilere atanan ağırlıkların modelin kayıp azaltımı üzerindeki etkisini ölçtü. İnceleme, onlarca milyondan yüz milyarlarca parametreye kadar uzanan şirket içi yoğun ve seyrek modeller ile açık ağırlıklı Qwen 2.5 ailesi üzerinde yürütüldü.

Araştırma sonuçları, veri ağırlığı etkisinin model boyutu büyüdükçe doğrusal olmayan ve dalgalı bir eğilim sergilediğini ortaya koydu. Küçük ölçekli modeller ağırlıklardan bağımsız olarak veri kümesindeki genel kalıpları öğrenirken, orta ölçekli modeller kendilerine verilen ağırlıklarla orantılı şekilde veriye özgü ayrıntıları kavrıyor. Yüz milyarlarca parametreye ulaşan büyük ölçekli modeller ise veri ağırlığı gözetmeksizin veri tabanındaki tüm kalıpları öğrenebilecek kapasiteye erişiyor.

Elde edilen bulgular, küçük modellerden elde edilen hiperparametrelerin büyük modellere doğrudan uyarlanamayacağını gösteriyor. Araştırma ekibi, eğitim dönemlerinin artırılmasının ağırlık duyarlılığı zirvesini daha küçük modellere kaydırdığını belirtti. Çalışma, büyük yapay zeka modelleri eğitilirken veri karışımı stratejilerinin yalnızca küçük ölçekli deneylere dayandırılarak tasarlanmasının hatalı sonuçlar doğurabileceğine işaret ediyor.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.