Büyük dil modelleri sınıflandırma yerine öznitelik mühendisliğinde kullanılıyor
Öne çıkanlar
- LLM kararlarının lojistik regresyona girdi yapılması Brier hata puanını 0,259'dan 0,175'e düşürdü.
- Modele 19 alt boyut sorusu ve metin kuralları eklendiğinde F1 skoru 0,747'den 0,779'a yükseldi.
- Geleneksel regresyon katmanı, dil modellerine karar eşiği ve olasılık kalibrasyonu denetimi kazandırıyor.
Büyük dil modellerinin doğrudan sınıflandırıcı olarak kullanılması; olasılık kalibrasyonu eksikliği, yapılandırılmış verileri dahil edememe ve karar eşiğini ayarlama güçlüğü gibi sorunlar yaratıyor. Yayımlanan teknik analiz, LLM çıktılarının nihai etiket yerine öznitelik olarak ele alınmasının bu kısıtlamaları aştığını gösterdi. Yaklaşım, model çıktılarının lojistik regresyon gibi geleneksel makine öğrenmesi algoritmalarıyla birleştirilmesini temel alıyor.
SemEval 2018 Görev 3 veri kümesindeki 4 bin 618 tweet üzerinde yapılan ironi tespit testlerinde Gemini 3.1 Flash Lite modeli denendi. Modelin tek başına ürettiği ikili sınıflandırma sonucu 0,747 F1 skoru ve 0,259 Brier puanı sağladı. LLM kararının lojistik regresyon ile sarılması, olasılıkları ampirik oranlarla kalibre ederek F1 skorunu korurken Brier puanını 0,175 seviyesine indirdi.
Deneyin sonraki aşamasında modele metnin mizah, tezatlık ve bağlam ihtiyacı gibi 19 farklı boyutunu inceleten alt sorular eklendi. Tweet uzunluğu, emoji ve etiket sayısı gibi kural tabanlı özniteliklerin de eklenmesiyle F1 skoru 0,779'a çıktı ve Brier puanı 0,127'ye geriledi. Bu sonuç, salt metin komutlarını optimize etmek yerine öznitelik tabanlı istatistiksel modeller kurmanın LLM doğruluğunu artırdığını kanıtladı.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.