Ana içeriğe geç
Yapay Zeka

Mia'a AI Lab 27 milyar parametreli modeli 16 GB ekran kartlarına getirdi

Öne çıkanlar

  • Qwen3.8-27B modeli, EXL3 formatıyla 16 GB VRAM'e sahip tek bir tüketici ekran kartında çalıştırıldı.
  • Paket, OpenAI uyumlu yerel API ve DeepSeek Harness tabanlı sohbet arayüzünü otomatik kuruyor.
  • Kurulum aracı, kartın boş bellek durumuna göre 2.0 ile 6.0 bpw arasındaki en uygun modeli seçiyor.

Mia'a AI Lab, turboderp tarafından geliştirilen EXL3 kuantizasyon formatını kullanarak Qwen3.8-27B büyük dil modelini tüketici sınıfı tek bir NVIDIA ekran kartında çalıştıran açık kaynaklı bir sunum kiti yayımladı. Proje, 16 GB VRAM sınırına sahip donanımlarda modelin yerel olarak dağıtılmasını hedefliyor. Sistem, kartın mevcut bellek miktarını otomatik tespit ederek uygun sıkıştırma seviyesini belirliyor, izole Python ortamını kuruyor ve bağımsız bir sohbet arayüzü sunuyor.

Araç paketi, 2.0 bpw ile 6.0 bpw arasında değişen modelleri destekliyor ve 16 GB bellek için varsayılan olarak 2.5 bpw seçeneğini öneriyor. Yapılandırma, int4 biçiminde KV önbelleği kullanarak bellek tüketimini dengeliyor ve 176 bin token context boyutuna kadar görsel girdi işleme imkanı tanıyor. Sistem üzerinde çalışan DeepSeek Harness tabanlı sohbet arayüzünün yanı sıra, diğer istemciler için OpenAI uyumlu bir yerel API uç noktası da eşzamanlı olarak hizmet veriyor.

Windows ve Linux sistemlerini destekleyen paket, kurulum sürecini grafiksel bir web sihirbazı veya terminal komutlarıyla yönetilebilir hale getirdi. Kod derleme ihtiyacını ortadan kaldıran önceden derlenmiş tekerlek dosyaları sayesinde CUDA Araç Kiti veya Visual Studio yükleme zorunluluğu bulunmuyor. Bellek yetersizliği durumunda modelleri sistem belleğine taşımak yerine VRAM kullanan diğer uygulamaları listeleyerek performansı koruyor.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.