Apple uzun metinleri görselle sıkıştıran LensVLM modelini yayımladı
Öne çıkanlar
- Apple, 9 milyar parametreli çok modlu modeli LensVLM-9B'yi kullanıma sundu.
- Model, belgeleri 5, 10 ve 15 kat oranlarında görsel olarak sıkıştırabiliyor.
- Transformers, vLLM ve SGLang gibi popüler kütüphaneler model çıkarımını destekliyor.
Apple, uzun metin bağlamlarını görsel olarak sıkıştırıp işleyen 9 milyar parametreli açık kaynak modeli LensVLM-9B'yi Hugging Face üzerinde paylaştı. Araştırma ekibi, modelin metin belgelerini sıkıştırılmış görüntüler biçiminde taradığını ve ardından öğrenilmiş araçlar aracılığıyla yalnızca ilgili sayfaları sıkıştırılmamış hallerine genişlettiğini açıkladı. Geliştirilen bu yöntem, uzun dokümanlardaki bağlam uzunluğu ve bellek sınırlarını görsel sıkıştırma teknikleriyle aşmayı amaçlıyor.
Yayımlanan model, Qwen mimarisi üzerinde Apple tarafından yapılan değişiklikleri içeriyor ve şirketin makine öğrenimi araştırma lisansı altında dağıtılıyor. Hugging Face deposundaki teknik ayrıntılara göre sistem; belgeleri 5 kat, 10 kat ve 15 kat oranında sıkıştırma seçenekleri sunuyor. Model; Transformers, vLLM ve SGLang gibi yaygın çıkarım kütüphaneleri ve sunucularıyla doğrudan çalışabilecek şekilde yapılandırıldı.
Araştırmacılar, GitHub üzerinden erişilebilen kaynak kodları Apple Örnek Kod Lisansı kapsamında geliştiricilerin kullanımına açtı. Docker ve yerel çıkarım araçlarıyla da entegre edilebilen model, görsel ve metin girdilerini bir arada işleyerek uzun belgeler üzerinde soru-cevap görevlerini düşük işlem maliyetiyle gerçekleştirmeyi hedefliyor.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.