Raspberry Pi üzerinde çalışan Axera NPU için llama.cpp arka ucu geliştirildi
Öne çıkanlar
- Axera AX8850 NPU üzerinde GGUF modellerini doğrudan çalıştıran açık kaynaklı ggml-axcl arka ucu geliştirildi.
- Sistem Raspberry Pi 5 üzerinde Qwen3-0.6B modeliyle saniyede 1,3-2,7 token üretim hızına ulaşıyor.
- Pulsar2 tabanlı özel matris çarpım katmanı sayesinde INT8 ağırlıklar doğrudan bellekten NPU'ya aktarılıyor.
Geliştirici woolcoxm, Axera AX8850 NPU hızlandırıcı kartında GGUF formatındaki modelleri doğrudan çalıştırmayı sağlayan "ggml-axcl" adlı özel bir llama.cpp arka ucu yayımladı. Raspberry Pi 5 üzerinde barındırılan sistem, Qwen3-0.6B modelini ek bir dönüştürme katmanına ihtiyaç duymadan doğrudan bellekten NPU motorlarına aktarıyor.
Mevcut sürümde Q8_0 ve Q4_K_M kuantizasyonları aynı kod yolu üzerinden saniyede 1,3 ila 2,7 token üretim hızına ulaşıyor. Üreticinin kapalı kaynaklı ve optimize edilmiş referans uygulaması saniyede 13,5 ila 16,9 token üretirken, açık kaynaklı arka uçtaki performans farkının işlemci ile NPU arasındaki veri aktarımı ve çizge parçalanmasından kaynaklandığı belirtildi. Model çalışırken token başına yaklaşık 120-140 NPU çağrısı gerçekleşiyor ve ara işlemler Raspberry Pi işlemcisi tarafından yönetiliyor.
Test sürecinde 14 otomatik testten 13'ünü başarıyla geçen projede, bellek sızıntısı olmadan art arda ve eşzamanlı çalıştırma doğrulandı. Geliştirici, tüm katmanı tek bir NPU çağrısına indirgeyen katman motorları ve zincirleme bellek yönetimi optimizasyonlarıyla performans açığını kapatmayı planlıyor.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.