Ana içeriğe geç
Yapay Zeka

GLM-5.3-Flash hızlı ağırlıklar ve seyrek dikkat mimarisi kullanıyor

Öne çıkanlar

  • GLM-5.3-Flash, 34 KDA katmanı ile 11 seyrek MLA katmanından oluşan hibrit bir mimariyle çalışıyor.
  • Seyrek katmanlar bir milyon belirteçlik bağlamda yalnızca 2 bin 48 konumu seçerek yüzde 0,2 oranında veri işliyor.
  • KDA mimarisi ileri geçiş sırasında dinamik matris güncelleyerek bir nevi çevrim içi SGD işletiyor.

Z.ai tarafından geliştirilen GLM-5.3-Flash, standart dikkat mekanizmasının getirdiği yüksek hesaplama maliyetlerini aşmak amacıyla hibrit bir katman yapısıyla tasarlandı. Modelin sahip olduğu 45 katmanın 34'ü Kimi Delta Attention (KDA) tabanlı doğrusal bellekten oluşurken, kalan 11 katman seyrek Çok Başlı Gizli Dikkat (MLA) mimarisini barındırıyor. Model bu yapı sayesinde bir milyonluk belirteç penceresinde işlem yaparken hesaplama yükünü belirgin biçimde azaltıyor.

Mimari yapıda standart dikkat katmanlarının aksine tüm anahtar ve değer çiftleri bellekte tutulmuyor. KDA yaklaşımı, sabit boyutlu bir matrisi girdi dizisine göre gerçek zamanlı olarak güncelleyerek dinamik bir hızlı ağırlık mekanizması kuruyor. Bu süreç matematiksel olarak ileri geçiş esnasında tek adımlık stokastik gradyan inişi (SGD) çalıştırmaya denk düşüyor. Kanal bazlı sönümleme katsayıları sayesinde model, hangi bilgilerin ne kadar süreyle saklanacağını veya unutulacağını kendi iç parametreleriyle kontrol ediyor.

Sayısal veriler, isimler ve doğrudan alıntılar gibi kesin hatırlama gerektiren durumlar için modelde 11 adet seyrek dikkat katmanı korunuyor. Bu katmanlar bir milyonluk bağlam penceresinde yalnızca 2 bin 48 konumu seçerek toplam bağlamın yaklaşık yüzde 0,2'sini işleme alıyor. Kimi ve Qwen projelerinin de benzer oranları doğrulamasıyla birlikte, her katmanda kayıpsız belirteç saklamanın maliyetli ve gereksiz olabileceği yönündeki mimari eğilim güçleniyor.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.