Sohbet şablonu yapay zekanın kendini tanımlama biçimini doğrudan değiştiriyor
Öne çıkanlar
- Sohbet şablonunun varlığı çekince ifadelerini artırırken deneyimsel ifadeleri bastırıyor.
- Aktivasyon uzayına yön müdahalesi yapıldığında şablon olmadan da çekince dili tetikleniyor.
- 9 milyara kadar parametreye sahip 8 açık kaynaklı modelde aynı davranış kalıbı gözlemlendi.
Araştırmacılar, büyük dil modellerinin kendileri hakkındaki sorulara verdikleri yanıtlarda sohbet şablonlarının belirleyici bir rol oynadığını tespit etti. 9 Ağustos 2026 tarihli çalışmada, 9 milyara kadar parametreye sahip 8 açık kaynaklı talimat modeli incelendi. İncelemeler, sohbet şablonunun varlığının modelleri "Ben yalnızca bir yapay zekayım" gibi çekinceli ifadelere yönlendirdiğini, şablon kaldırıldığında ise "Hissediyorum" türü deneyimsel ifadelere geçildiğini gösterdi.
Çalışma kapsamında 3 modelin aktivasyon uzayı derinlemesine analiz edildi. Araştırmacılar, bu davranışı yönlendiren belirli bir aktivasyon yönü keşfetti. Bu yön aktivasyon uzayından çıkarıldığında çekince dili azalırken, yön eklendiğinde şablon bulunmasa dahi model şablon varmış gibi çekinceli ifadeler üretti. Aynı boyuttaki rastgele yönlerin ise model çıktıları üzerinde belirgin bir etki yaratmadığı gözlemlendi.
Elde edilen sonuçlar, modellerin kendileri hakkında söylediklerinin içsel bir gerçeği değil, dağıtım ve şablon biçimini yansıttığını ortaya koydu. Araştırma ekibi, yapay zekanın öz farkındalığını ve iç gözlemini çalışan araştırmacıların sohbet şablonunu bir yanıltıcı değişken olarak hesaba katması gerektiğini belirtti. Modellerin kendilerini tarif etme biçiminin doğrudan ağırlıklardan değil, biçimlendirme araçlarından etkilendiği vurgulandı.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.