Ana içeriğe geç
Yapay Zeka

LLM'leri sonraki belirteç tahmincisi olarak tanımlamak eksik kalıyor

Öne çıkanlar

  • Ön eğitim modelleri yalnızca mevcut veri setindeki sonraki belirteçleri tahmin etmeye odaklanıyor.
  • RLVR yöntemi modellerin daha önce görülmemiş yeni dizileri keşfetmesine ve ödüllere göre öğrenmesine imkan tanıyor.
  • Sonraki belirteç tanımı üretim döngüsünü açıklarken sistemin öğrendiği stratejik bilgiyi göz ardı ediyor.

Yapay zeka alanında büyük dil modellerini (LLM) yalnızca bir sonraki belirteci tahmin eden sistemler olarak niteleyen zihinsel modelin eksik kaldığı açıklandı. Transformer tabanlı modeller metinleri teknik olarak belirteç belirteç üretse de modern modellerin eğitimi yalnızca mevcut verilerdeki bir sonraki adımı tahmin etmeye dayanmıyor. Temel modeller ön eğitim aşamasında veri setindeki kalıpları kopyalamaya odaklanırken, son kullanıcıya ulaşan güncel modeller kapsamlı eğitim sonrası (post-training) süreçlerinden geçiyor.

Eğitim sonrası süreçte kullanılan doğrulanabilir ödüllerle pekiştirmeli öğrenme (RLVR), modellerin kendi ürettiği yeni dizileri keşfetmesini sağlıyor. Bu yöntemde model, mevcut eğitim verisinde hiç yer almayan metin dizileri oluşturuyor ve elde ettiği sonuca göre ödüllendiriliyor. Bu mekanizma, sadece büyük usta satranç oyunlarını taklit eden bir tahmin algoritması ile kendi oynadığı oyunları analiz edip kazanma olasılığını artıran gelişmiş bir satranç motoru arasındaki farka benziyor.

İnsan geri bildirimiyle pekiştirmeli öğrenme (RLHF) gibi diğer yöntemler de modellerin ham veri taklidinden çıkarak yardımcı bir asistan kimliğine bürünmesini sağlıyor. Sonraki belirteç mekanizması yalnızca teknik çalışma biçimini yansıtıyor ancak bu döngünün keşif ve hedef odaklı davranışları kodladığı gerçeğini açıklamıyor. Bu nedenle LLM'leri basit birer sonraki kelime tahmincisi olarak tanımlamak sistemin ulaştığı keşif ve muhakeme kabiliyetini göz ardı ediyor.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.