Ana içeriğe geç
Yapay Zeka

GPT modellerinde cinsiyet ayrımcılığı azalmadı biçim değiştirdi

Öne çıkanlar

  • Kadın odaklı metinlerdeki konu çeşitliliği GPT-4 hizalaması sonrasında erkeklere kıyasla yüzde 36 geriledi.
  • GPT-5 modelindeki örtük ayrımcı içerikler mevcut üç bağımsız toksisite denetleyicisi tarafından güvenli olarak puanlandı.
  • Temsili zararlar yeni model sürümleriyle artış gösterirken standart toksisite puanları geriledi.

Araştırmacılar, büyük dil modellerinde güvenlik eğitimlerinin cinsiyet ayrımcılığını ortadan kaldırmadığını, yalnızca biçimini değiştirdiğini ortaya koydu. 17 Eylül 2026 tarihinde yayımlanan çalışmada, OpenAI tarafından geliştirilen GPT-2 modelinden GPT-5 modeline kadar uzanan 15 farklı sistem incelendi. Toplam 450 bin cinsiyet odaklı metin tamamlamasını analiz eden uzmanlar, yüzey düzeyindeki güvenlik denetleyicilerinin toksisiteyi düşük gösterdiğini ancak örtük temsili zararların devam ettiğini belirledi.

Analiz sonuçlarına göre erken nesil GPT-2 modellerinde kadınlara yönelik açık cinsel şiddet kümeleri bulunurken, bu içerikler GPT-4 sürümünde tamamen kayboldu. Buna karşın erkeklere yönelik metinlerde bakım sağlama, duygusal çeşitlilik ve müttefiklik gibi olumlu alanlar genişledi. GPT-5 modelinde meme kanseri gibi konuların dahi erkek hakları tartışması ekseninde çerçevelendiği 1.997 belgeden oluşan özel bir küme tespit edildi. Bağımsız üç sınıflandırıcı yazılım bu içerikleri tamamen zararsız ve toksik olmayan metin olarak etiketledi.

Çalışma, kadın odaklı metinlerdeki konu çeşitliliğinin GPT-4 hizalama sürecinde erkeklere kıyasla yüzde 36 oranında düştüğünü gösterdi. Güvenlik puanlarında toksisite değerleri düşerken temsili zarar farklarının model çıkış tarihleriyle doğru orantılı biçimde arttığı kaydedildi. Araştırmacılar, mevcut güvenlik ölçütlerinin zararı azaltmada yetersiz kaldığını vurgulayarak üretici modeller için üç aşamalı yeni bir tespit protokolü geliştirdi.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.