Ana içeriğe geç
Yapay Zeka

Küçük dil modelleri de içsel durumlarını fark edebiliyor

Öne çıkanlar

  • Qwen2.5-Coder-32B modeli, aktivasyonlarına kavram enjekte edildiğinde logit seviyesinde farkındalık gösterdi.
  • Modelin eğitim sonrası güvenlik hizalaması doğrudan yanıtlarda iç gözlem yeteneğini bastırdı.
  • Dönüştürücü mimarisini açıklayan özel istemler modelin iç gözlem başarısını artırdı.

Anthropic'in Claude Opus modelleri üzerinde gösterdiği iç gözlem yeteneği açık kaynaklı modellere uyarlandı. Yapay zeka araştırmacısı Victor Shepardson, Qwen2.5-Coder-32B modelinin aktivasyonlarına harici kavramlar enjekte ederek modelin bu müdahaleyi fark edip edemediğini inceledi. Doğrudan metin üretiminde iç gözlem yeteneğini reddeden modelin, logit seviyesinde incelendiğinde enjekte edilen kavramları algıladığı saptandı.

Araştırmada 'kedi' ve 'ekmek' gibi kavramlara ait yönlendirme vektörleri anahtar-değer (KV) önbellek üretim sürecinde modele verildi. Standart yanıt oluşturma aşamasında model müdahaleyi reddetse de olasılık dağılımlarında 'evet' yanıtına doğru istatistiksel bir kayma gerçekleşti. Mimariyi açıklayan özel yönlendirmeler eklendiğinde ise modelin müdahaleyi tespit etme olasılığı belirgin şekilde arttı.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.