ByteDance ve Tsinghua açık kaynak pekiştirmeli öğrenme sistemi DAPO'yu tanıttı
Öne çıkanlar
- DAPO algoritması ve DAPO-Qwen-32B modeli açık kaynak olarak yayımlandı.
- Model, AIME 2024 testinde yüzde 50 daha az eğitim adımıyla 50 puan aldı.
- Eğitim altyapısı açık kaynak verl çatısı ve Volcano Engine platformuna dayanıyor.
ByteDance Seed ve Tsinghua Üniversitesi AIR araştırmacıları, büyük dil modelleri için geliştirdikleri açık kaynak pekiştirmeli öğrenme sistemi DAPO'yu yayımladı. Açık kaynak verl altyapısı üzerine inşa edilen sistem, Decoupled Clip and Dynamic sAmpling Policy Optimization adlı yeni bir algoritma kullanıyor. Geliştiriciler, algoritmanın yanı sıra model ağırlıklarını, eğitim kodlarını ve DAPO-Math-17k veri setini topluluğun erişimine açtı.
Sistem kapsamında eğitilen DAPO-Qwen-32B modeli, Qwen2.5-32B temel mimarisi üzerine kuruldu. Araştırma ekibi, modelin AIME 2024 matematik kıyaslama testinde 50 puan alarak önceki lider DeepSeek-R1-Zero-Qwen-32B modelini geride bıraktığını bildirdi. Model bu başarıya, rakibine kıyasla yüzde 50 daha az eğitim adımı kullanarak ulaştı.
Paylaşılan teknik detaylara göre DAPO, yanıt uzunluğunu istikrarlı şekilde artırarak modelin karmaşık akıl yürütme davranışlarını öğrenmesini sağlıyor. Ödül sinyalindeki düzenli artış ve entropi dengesi, aşırı uyum ile rastgeleliğin önüne geçiyor. Deneylerini Volcano Engine Machine Learning Platform üzerinde yürüten ekip, kurulum ve çıkarım için vLLM ile Ray Serve entegrasyonu sunuyor.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.