Apple metinleri görsel olarak sıkıştıran LensVLM modelini tanıttı
Öne çıkanlar
- LensVLM, 4,3 kat etkili sıkıştırma oranında tam metin üst sınırına denk bir doğruluk düzeyi yakaladı.
- Model, 10,1 kata varan sıkıştırma düzeylerinde metin ve görsel temelli diğer modelleri geride bıraktı.
- Sistem, Qwen3.5-9B-Base mimarisi üzerine inşa edildi ve çok modlu kod ile belge görevlerine de uyum sağlıyor.
Apple araştırmacıları, metinleri işlenmiş görüntüler olarak okuyan görme dili modellerindeki çözünürlük kaybını önlemek amacıyla LensVLM adlı yeni bir çıkarım çerçevesi ve eğitim yöntemi geliştirdi. Görme dili modelleri, metinleri standart belirteç dizileri yerine görüntü formatında işleyerek bağlam uzunluğunu azaltabiliyor. Ancak görseller sıkıştırıldıkça karakterlerin küçülmesi modelin okuma başarısını doğrudan düşürüyor. LensVLM, önce sıkıştırılmış görseli tarayarak ardından yalnızca gerekli bölümleri araçlar yardımıyla orijinal haline genişleterek bu kaybın önüne geçiyor.
Qwen3.5-9B-Base modeli temel alınarak geliştirilen sistem, yedi farklı metin tabanlı soru-cevap testinde 4,3 kat sıkıştırma oranında bile tam metin doğruluğuna eşdeğer sonuçlar veriyor. Araştırma ekibi, sistemin 10,1 kat sıkıştırma seviyesine kadar olan ölçümlerde metin ve görsel sıkıştırma tabanlı diğer temel yaklaşımları geride bıraktığını kaydetti. LensVLM, metin görevlerinin yanı sıra çok modlu belge analizi ve kod anlama senaryolarında da etkili bir performans gösteriyor.
Yapılan analizler, modelin sıkıştırma oranı arttıkça zayıflayan görsel algılama yerine seçici olarak genişletilen net içeriklere yöneldiğini gösterdi. Araştırmacılar, düz metinler için metin genişletme aracının tercih edilmesini, sayfa düzeninin önem taşıdığı belgelerde ise yüksek çözünürlüklü görsel genişletmenin kullanılmasını öneriyor. Bu yaklaşım, dil modellerinde uzun metinlerin bellek kullanımını azaltırken işlem verimliliğini korumayı hedefliyor.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.