Görsel modeller için olasılık temelli sınıflandırma yöntemi geliştirildi
Öne çıkanlar
- Yöntem, modelin tek belirteç üretmesini zorunlu kılarak olasılık dağılımını puanlıyor.
- RTX 3090 üzerinde çalışan Gemma 4 12B modeli saniyede 1 kare analiz hızı yakaladı.
- OpenAI API üzerinden yapılan testlerde saniyede 0,2 kare işleme hızına ulaşıldı.
Jev ve SemIf gibi projelerden esinlenen bağımsız bir geliştirici, büyük dil modellerinin belirteç olasılıklarını (logprobs) okuyarak hızlı ve esnek görsel sınıflandırma yapan Python tabanlı bir yöntem yayımladı. Modelin tek bir harf veya seçenek üretmesini sağlayıp alternatif belirteç olasılıklarını inceleyen bu yaklaşım, web kamerası görüntülerinin gerçek zamanlıya yakın hızlarda etiketlenmesine olanak tanıyor.
Geliştirilen sistem, web kamerasından alınan kareleri base64 formatında kodlayarak modele iletiyor ve her kare için ortam aydınlığı, insan varlığı gibi soruları yanıtlıyor. Testlerde, yerel olarak RTX 3090 üzerinde llama.cpp ile çalıştırılan Gemma 4 12B modeli saniyede yaklaşık 1 kare hızına ulaştı. Bulut tarafında OpenAI gpt-6-luna ile yapılan denemelerde ise bağlantı maliyetleri nedeniyle saniyede 0,2 kare elde edildi.
Yöntem, özel bilgisayarlı görü modelleri kadar yüksek hız sunmasa da görsel koşulların doğrudan doğal dille tanımlanabilmesi sayesinde büyük esneklik sağlıyor. Paylaşılan açık kaynaklı kod, hem yerel llama.cpp sunucularını hem de OpenAI API altyapısını destekliyor.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.