Ana içeriğe geç
Yapay Zeka

Picchio yerel yapay zeka modellerindeki GPU darboğazlarını analiz ediyor

Öne çıkanlar

  • Tüm katmanları GPU'da kalan Qwen3.8-27B modeli RTX 5090 üzerinde saniyede 81,5 belirteç üretti.
  • RTX 4070 Super modelinde 28 katmanın CPU'ya taşınması hızı saniyede 5,7 belirtece düşürdü.
  • Picchio aracı donanım kullanımı, güç tüketimi ve belirteç hızını tek raporda topluyor.

Geliştirici ekibi, yerel büyük dil modellerinin donanım performansını ve bellek dağılımını analiz eden açık kaynaklı Picchio aracının 1.0.0 sürümünü yayımladı. Araç, modellerin GPU ve CPU arasındaki katman yerleşimlerini takip ederek performans kayıplarının kaynağını tespit ediyor.

Yapılan testlerde Qwen3.8-27B modeli 32 GB bellekli RTX 5090 üzerinde tüm 66 katmanıyla GPU'da çalışırken saniyede 81,5 belirteç hızına ulaştı. Modelin 12 GB bellekli RTX 4070 Super üzerinde çalıştırılması durumunda ise 28 katman CPU'ya aktarıldı ve hız saniyede 5,7 belirtece gerileyerek 14,3 katlık bir performans düşüşü kaydetti.

Python 3.9 ve üzeri sürümlerle çalışan araç, katman dağılımının yanı sıra ön yükleme, kod çözme hızı, bellek kullanımı, güç tüketimi ve belirteç başına enerji maliyetini raporluyor. Yazılım ayrıca Ollama ve llama.cpp projeleri için doğrudan hata raporu formatında çıktı üretebiliyor.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.