OpenAI'ın yeni akıl yürütme tekniği güvenlik uzmanlarını endişelendirdi
Öne çıkanlar
- OpenAI'ın Astra modeli, sıralı akıl yürütme yerine döngüsel derinlik tekniğini kullanıyor.
- Güvenlik araştırmacıları, tekniğin düşünce zinciri denetimini engelleyebileceğini belirtti.
- OpenAI Baş Bilim İnsanı Jakub Pachocki, okunabilir düşünce kayıtlarını koruyacaklarını açıkladı.
OpenAI'ın yeni Astra modelinde döngüsel derinlik olarak da bilinen opak tekrarlama tekniğini kullanacağı bildirildi. The Information'ın haberine göre bu yöntem, modelin sıralı düşünme sürecinin dışına çıkmasını sağlıyor. Güvenlik uzmanları, bu yaklaşımın modellerin düşünce zincirini denetlemeyi zorlaştıracağını belirterek sürece tepki gösterdi.
Normal şartlarda akıl yürütme modellerinin düşünce zinciri kayıtları, hatalı veya zararlı davranışların tespitinde önemli bir denetim mekanizması sunuyor. Opak tekrarlama tekniğinde ise model aynı sorguyu doğrusal olmayan bir döngü içinde işliyor ve arkasında daha az okunabilir iz bırakıyor. Redwood CEO'su Buck Shlegeris ve sektör araştırmacıları, bu yöntemin yaygınlaşmasının düşünce zinciri izlenebilirliğini tamamen ortadan kaldırabileceğini aktardı.
OpenAI Baş Bilim İnsanı Jakub Pachocki, şirketin okunabilir düşünce zincirlerini koruma konusundaki kararlılığını sürdürdüğünü ve Astra'da tekniğin sınırlı bir şekilde yer alacağını ifade etti. Şirket kapsamlı denetim sistemleri geliştirmeyi planladığını belirtirken, Anthropic ve Google DeepMind gibi rakip laboratuvarların da benzer yaklaşımları değerlendirdiği bildirildi.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.