Araştırmacılar üçlü dil modellerinde 1,58 bit sınırını aştı
Öne çıkanlar
- Test edilen 29 modelde sıfır değerindeki ağırlıkların oranının yüzde 51,5 seviyesine kadar çıktığı belirlendi.
- BITCOS düzeni, en seyrek modelde depolama maliyetini ağırlık başına 1,485 bite kadar düşürdü.
- Yeni yaklaşım matris-vektör çarpım çekirdeklerinde 1,28 kata kadar performans artışı sağladı.
- Uçtan uca testlerde çıkarım hızı CPU üzerinde 1,18 kat, GPU üzerinde 1,27 kat hızlandı.
Araştırmacılar, üçlü büyük dil modellerinde ağırlık başına düşen bellek tüketimini 1,58 bit teorik sınırının altına indiren BITCOS adlı yeni bir veri düzeni geliştirdi. 14 Eylül 2026 tarihinde yayımlanan çalışmada, ağırlıkları yalnızca eksi bir, sıfır ve artı bir değerlerinden oluşan modellerin mevcut beşli paketleme yöntemiyle bayt başına yaklaşık 1,625 bit harcadığı, ancak modellerdeki sıfır oranının yüzde 51,5 seviyesine kadar ulaştığı saptandı.
Dağılıma uyarlanabilir bir yapı sunan BITCOS mimarisi, ağırlık mevcudiyetini gösteren yoğun bir bit haritası ile sıkıştırılmış bir işaret vektörünü birleştiriyor. Sıfır yoğunluğuna bağlı olarak ağırlık başına maliyeti düşüren bu yöntem, test edilen 29 modelin 26'sında geleneksel paketleme yönteminden daha az yer kapladı. En yüksek seyrekliğe sahip modelde depolama gereksinimi ağırlık başına 1,485 bite kadar geriledi.
Yeni mimari, modern donanımlarda yüksek verim sağlayacak şekilde AVX-512, AVX2 ve Intel Xe2 GPU komut kümeleriyle optimize edildi. Matris-vektör çarpım işlemlerinde 1,28 kata varan hızlanma elde edilirken, beş farklı işlemci ve GPU platformunda yapılan uçtan uca çıkarım testlerinde model kod çözme hızı CPU üzerinde 1,18 kat, GPU üzerinde ise 1,27 kat arttı.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.