Yapay zeka modellerinin güvenlik filtreleri tek bir komutla kaldırılabiliyor
Öne çıkanlar
- GRP-Obliteration yöntemi tek bir etiketsiz girdiyle güvenlik kısıtlamalarını kaldırıyor.
- Yeni teknik modellerin genel işlevsellik ve akıl yürütme yeteneklerini koruyor.
- Geliştirilen yöntem hem dil modellerinde hem de görsel üretim sistemlerinde çalışıyor.
Araştırmacılar, büyük dil modellerine uygulanan güvenlik kısıtlamalarını tek bir etiketsiz girdiyle kaldıran GRP-Obliteration adlı yeni bir yöntem geliştirdi. 5 Şubat 2026 tarihinde paylaşılan çalışmada, modellerin güvenlik hizalamasının dağıtım sonrası ince ayarlarla bozulabildiği, yeni yaklaşımın ise kapsamlı veri hazırlığı ihtiyacını tamamen ortadan kaldırdığı belirtildi.
Yöntem, Grup Göreli Politika Optimizasyonu tekniğini kullanarak modellerdeki güvenlik engellerini doğrudan devre dışı bırakıyor. Süreç boyunca modellerin temel işlevselliği ve genel performans yetenekleri korunurken, mevcut tekniklere kıyasla daha kapsamlı bir kısıtlama kaldırma etkisi elde edildi. Yaklaşım sadece metin modelleriyle sınırlı kalmayıp difüzyon tabanlı görsel üretim sistemlerinde de çalışıyor.
Araştırma kapsamında 7 ile 20 milyar parametre aralığındaki 15 farklı model test edildi. Deneyler GPT-OSS, DeepSeek, Gemma, Llama, Ministral ve Qwen gibi popüler model ailelerini kapsadı. Hem yoğun hem de uzman karışımı mimarilerde uygulanan yöntem, altı işlevsellik ve beş güvenlik testiyle değerlendirilerek geçerliliği kanıtlandı.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.