Dünya modeli Pokemon oyununda ödül mekanizması olmadan planlama yaptı
Öne çıkanlar
- Araştırmacı, JEPA tabanlı LeWorldModel yapısını Pokémon Red oyununa uyarlayarak yerel donanımda eğitti.
- Temsil çöküşünü önlemek için 192 boyutlu gömme uzayında SIGReg düzenlileştirme tekniği uygulandı.
- Model, ödül fonksiyonu olmadan 14 adımlık tuş dizilimini planlayarak Squirtle karakterini seçti.
Yapay zeka araştırmacısı, Yann LeCun tarafından önerilen JEPA mimarisine dayanan LeWorldModel yapısını kullanarak Pokémon Red oyununda bir dünya modeli eğitti. Yerel bir RTX 3080 Ti ekran kartında yürütülen çalışmada model, geleneksel pekiştirmeli öğrenmedeki ödül mekanizmalarına ihtiyaç duymadan, ekran görüntüleri ve tuş vuruşları arasındaki dinamikleri örtük uzayda öğrendi. Amaç, Profesör Oak'ın laboratuvarında Squirtle, Charmander veya Bulbasaur karakterlerinden birini seçmek olarak belirlendi.
Eğitim sürecinde Game Boy emülatöründen toplanan 42 binden fazla gri tonlamalı kare ve 1000'i aşkın hareket kaydı kullanıldı. Ekran görüntülerinin 192 boyutlu vektörlere dönüştürüldüğü sistemde tüm temsillerin tek noktada toplanmasını engellemek amacıyla SIGReg düzenlileştirme tekniği uygulandı. Çapraz entropi yöntemiyle 14 adımlık tuş dizilimleri simüle edildi ve başlangıçta hedefe ulaşılamasa da ardışık tahmin hatalarını azaltan ince ayar tekniği sayesinde model başarıyla Squirtle karakterini seçti.
Deney, dünya modellerinin doğrudan piksel üretmek yerine gizil uzaydaki temsiller üzerinden eylem öngörüsü ve planlama yapabileceğini somutlaştırdı. İlk denemelerde biriken tahmin sapmaları nedeniyle başarısız olan planlama aşaması, modelin kendi öngörüleri üzerinde eğitilmesiyle aşıldı. Araştırma, ödül fonksiyonu tasarlamadan ortam dinamiklerini öğrenen yapay zeka sistemlerinin potansiyelini ortaya koydu.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.