Yapay zeka sistemlerinde kişisel veri maskeleme katmanları sessizce sızıntıya yol açabiliyor
Öne çıkanlar
- Varsayılan NER modelleri vergi numarasını geçip metindeki vergi etiketi sözcüğünü kuruluş adı olarak maskeledi.
- Rastgele üretilen 9 basamaklı sayıların yüzde 9,95'i vergi numarası doğrulama algoritmasından başarıyla geçti.
- Güven eşiği 0,7 seviyesine çıkarıldığında filtreleme katmanı hiçbir hata vermeden tespit oranını sıfıra düşürdü.
Yazılım mühendisi Petros Savvakis, büyük dil modellerinin (LLM) önüne yerleştirilen Microsoft Presidio tabanlı kişisel veri (PII) maskeleme katmanlarının yapılandırma hataları nedeniyle veriyi sızdırabileceğini açıkladı. Bir destek talebinde paylaşılan Yunanistan vergi numarasının (AFM) ABD'deki sunuculara gitmesi üzerine geliştirilen ilk maskeleme çözümü, vergi numarası yerine doğrudan 'AFM' etiketini gizledi. Sistem HTTP 200 başarılı durum kodu döndürürken hassas veriyi üçüncü ülkedeki çıkarım günlüklerine aktarmaya devam etti.
Savvakis, Presidio'nun varsayılan İngilizce modellerinin farklı dillerde ve yerel kimlik formatlarında yetersiz kaldığını belirtti. Yunanca vergi numarası doğrulama algoritmasının rastgele dokuz basamaklı sayıları yaklaşık yüzde 10 oranında geçerli saydığı tespit edildi. Güven eşiğinin 0,7 seviyesine çıkarılması durumunda tespit mekanizmasının hiçbir uyarı vermeden sıfır başarı oranına (recall) düştüğü ve tüm hassas veriyi modele ilettiği kaydedildi.
Sürecin sadece basit bir dize gizleme işlemi olmadığını belirten Savvakis, izin verilen varlık listesi, normalizasyon adımları ve test paketlerine entegre edilen eşik denetimlerinin zorunlu olduğunu vurguladı. Tespit mekanizmasının ürettiği bulguların imzalı denetim kayıtlarına işlenmesi ve GDPR uyumluluğu için yönlendirme kararlarında kullanılması gerektiği aktarıldı.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.