Yapay zeka hakemleri klinik notlardaki bilgi eksikliklerini tespit edemiyor
Öne çıkanlar
- Standart LLM hakemleri klinik notlardaki eksik bilgileri yalnızca yüzde 50-63 doğrulukla tespit etti.
- Uydurulan veya değiştirilen içeriklerin tespitinde başarı oranı yüzde 79-94 aralığında gerçekleşti.
- Görüşme kaydındaki olguları listeleyip tek tek kontrol eden yeni yöntem eksiklik tespitini kurtardı.
Klinik ortamda doktor-hasta görüşmelerini dinleyerek otomatik not çıkaran yapay zeka sistemlerinin en büyük hatası bilgi atlama veya eksik bırakma olarak öne çıkıyor. Bu notları denetlemek için kullanılan LLM hakem sistemleri ise eklenen veya değiştirilen yanlış bilgileri başarıyla yakalarken eksik bırakılan bilgileri tespit etmekte yetersiz kalıyor. arXiv üzerinden yayımlanan yeni bir araştırma, 500 hata çiftinden oluşan özel bir veri setiyle sekiz farklı LLM hakem mimarisini test etti.
Araştırma sonuçlarına göre standart LLM hakemleri, uydurulan veya değiştirilen bilgileri yüzde 79 ila yüzde 94 doğrulukla ayırt ederken eksik bırakılan bilgileri sadece yüzde 50 ila yüzde 63 oranında, yani yazı tura seviyesinde yakalayabildi. İstem değişiklikleri, oylama yöntemleri veya prompt optimizasyonları tek başına bu körlüğü çözmeye yetmedi. Araştırmacılar sorunun çözümünün görevin yapısını değiştirmekten geçtiğini belirledi.
Görüşme kaydındaki olguları önce madde madde listeleyen ve ardından notta bu olguların yer alıp almadığını tek tek denetleyen yeni bir yöntem geliştirildi. Bu yaklaşım, eksik bilgileri düşük yanlış alarm oranıyla yakalamayı başardı ve uzman hekim değerlendirmeleriyle de doğrulandı. Ekip, geliştirdikleri kıyaslama veri setini ve istem modellerini açık kaynak olarak paylaştı.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.