Ana içeriğe geç
Yapay Zeka

FreeToken büyük MoE modellerini tüketici bilgisayarlarında çalıştırıyor

Öne çıkanlar

  • FreeToken, 290 milyardan fazla parametreye sahip MoE modellerini tüketici bilgisayarlarında çalıştırıyor.
  • Bant genişliğine duyarlı yürütme motoru, CPU ve GPU kaynaklarını tek bir elastik platform olarak kullanıyor.
  • NVIDIA RTX 30, 40 ve 50 serisi ekran kartları ve modern kuantizasyon formatları yerel olarak destekleniyor.

FlashML ekibi, 290 milyardan fazla parametreye sahip açık ağırlıklı Uzmanlar Karması (MoE) modellerini kişisel bilgisayarlarda yerel olarak çalıştırmayı sağlayan FreeToken motorunu duyurdu. Araç; GPU, CPU, sistem belleği ve ara bağlantıları tek bir elastik çıkarım platformu olarak birleştiriyor. Yazılım, oyuncu bilgisayarlarında ve tüketici düzeyindeki donanımlarda veri merkezi ölçeğindeki yapay zeka modellerinin yüksek hızda yürütülmesine olanak tanıyor.

Geliştirilen sistem, bant genişliğine duyarlı CPU ve GPU ortak yürütme mimarisi ile dinamik VRAM yönetimini kullanıyor. Sistem; uzman önbellekleri ile KV belleği arasındaki alanı, modelleri yeniden yüklemeye gerek kalmadan anlık olarak yeniden dağıtabiliyor. Ayrıca anlamsal önbellekleme desteği sayesinde, araç çağırma veya düşünme blokları gibi bağlam değişikliklerinde yinelenen hesaplamaların önüne geçiliyor.

FreeToken; DeepSeek, Qwen ve GLM gibi önde gelen MoE mimarilerini ve MXFP4, NVFP4, FP8 gibi farklı kuantizasyon formatlarını destekliyor. Windows ve Linux platformlarında grafik arayüz veya Python paket yöneticileriyle kurulabilen motor, NVIDIA RTX 30, 40 ve 50 serisi tüketici ekran kartlarıyla uyumlu çalışıyor.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.