Ana içeriğe geç
Yapay Zeka

NanoGPT Speedrun GPT-2 seviyesini 75 saniyenin altına indirdi

Öne çıkanlar

  • GPT-2 düzeyindeki modelin 8 adet H100 GPU ile eğitim süresi 45 dakikadan 75 saniyenin altına indi.
  • Hedeflenen kayıp değerine ulaşmak için gereken veri miktarı 10 milyar tokenden 400 milyonun altına geriledi.
  • Performans kazanımı Muon eniyileyicisi, FP8 kullanımı ve mimari yeniliklerle elde edildi.

Açık kaynak topluluğu tarafından yürütülen modded-nanogpt projesi, GPT-2 seviyesindeki bir dil modelinin eğitim süresini 8 adet NVIDIA H100 GPU üzerinde 75 saniyenin altına düşürdü. Andrej Karpathy'nin llm.c projesindeki 45 dakikalık referans eğitim süresini temel alan yarışma, FineWeb doğrulama veri kümesinde 3,28 kayıp değerine ulaşmayı hedefliyor.

Elde edilen hız artışı, Muon ve NorMuon optimizasyon algoritmaları, Flash Attention 3, FP8 duyarlılığı ve mimari iyileştirmeler sayesinde sağlandı. Model, orijinal sistemde gereken 10 milyar token yerine 400 milyonun altında token işleyerek hedef doğrulama başarısına ulaştı.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.