Ana içeriğe geç
Yapay Zeka

Metin filigranı yapay zeka ajanlarının davranışlarını ve güvenliğini değiştiriyor

Öne çıkanlar

  • SynthID-Text filigranı yedi dil modelinden altısında araç çağırma doğruluğunu düşürdü.
  • Filigranlı ve filigransız modeller arasındaki eşleştirilmiş uyuşmazlık ortalama yüzde 6,5 oldu.
  • İstem enjeksiyonu altında Gemma-3-27B modelinin zararlı isteklere uyma oranı 12,5 puan arttı.
  • Güvenlik zafiyeti ve karar sapması kullanılan filigran anahtarına bağlı olarak geniş çapta değişti.

Lasso Security araştırmacıları, büyük dil modellerine eklenen görünmez metin filigranlarının yapay zeka ajanlarının karar alma süreçlerini ve güvenlik davranışlarını doğrudan etkilediğini açıkladı. Anthropic'in Claude modellerinde Google DeepMind kaynaklı SynthID-Text filigranını kullanmaya başlayacağını duyurması ve Avrupa Birliği Yapay Zeka Yasası'nın getirdiği yasal zorunluluklar konuyu öne çıkardı. Yapılan deneyler, üretim aşamasında belirteç seçimini değiştiren Tournament örneklemesinin, ajanların araç çağırma doğruluğunu düşürdüğünü ve zararlı istemleri reddetme mekanizmasını zayıflattığını ortaya koydu.

Araştırma kapsamında yedi farklı dil modeli BFCL v4 ve HarmBench veri kümeleri üzerinden eşleştirilmiş testlerle incelendi. Araç çağırma testlerinde filigran kullanımı incelenen yedi modelden altısında doğruluğu düşürdü; modeller ve sıcaklık dereceleri genelinde eşleştirilmiş uyuşmazlık oranı ortalama yüzde 6,5 olarak ölçüldü. Bu sapma; modellerin yanlış araç seçmesine, bozuk sözdizimi üretmesine veya sorgu, yol ve alıcı gibi kritik parametreleri hatalı belirlemesine yol açtı. Genel başarı oranları birbirini dengelese de filigranlı ve filigransız çıktılar arasında belirgin davranış farklılıkları kaydedildi.

Filigran uygulamasının güvenlik etkileri özellikle doğrudan istem enjeksiyonu saldırılarında belirginleşti. Gemma-3-27B modelinde zararlı isteklere uyma oranı enjeksiyon altında 12,5 puan artış gösterirken, uyuşmazlık oranı yüzde 6'dan yüzde 23,5 seviyesine çıktı. Araştırmacılar, kullanılan gizli filigran anahtarının değişmesiyle modellerin saldırılara karşı kırılganlığının da ciddi oranda dalgalandığını bildirdi. Çalışma, içerik kaynağını belirlemek için geliştirilen mekanizmaların ajan güvenliğinin bir parçası olarak yeniden test edilmesi gerektiğini gösterdi.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.