Blackwell B200 için sıfırdan CUDA attention çekirdeği geliştirildi
Öne çıkanlar
- CUDA ve PTX ile sıfırdan yazılan çekirdek, FlashAttention-4 performansının yüzde 94,4'üne ulaştı.
- B200 donanımındaki asimetrik ölçeklenme nedeniyle softmax adımı ana hesaplama darboğazı oldu.
- Tüm mimariyi ve optimizasyon adımlarını aktaran 60 şemalık rehber ve kodlar açık kaynak olarak sunuldu.
Yazılımcı ve araştırmacı Iaroslav Elistratov, Nvidia'nın yeni nesil Blackwell B200 grafik işlemcisi üzerinde çalışan özel bir yoğun attention çekirdeği geliştirdiğini açıkladı. Paylaşılan rehber, 60 görsel şema ve 14 aşamalı optimizasyon adımı üzerinden sıfırdan FlashAttention-4 performansının yüzde 94,4'üne ulaşan bir CUDA ve PTX çekirdeğinin nasıl inşa edildiğini anlatıyor.
Çalışma, Blackwell mimarisinde tensör çekirdeği hızının iki katına çıkmasına rağmen üstel matematik birimlerinin (MUFU/ALU) geride kalmasıyla ortaya çıkan donanımsal asimetriyi odağına alıyor. Bu durumun softmax işlemlerini ana darboğaz haline getirdiğini belirten geliştirici, optimizasyonların softmax yükünü hafifletme ve matris çarpımlarıyla (MMA) örtüştürme üzerine kurulduğunu aktardı. Geliştirilen nihai çekirdek, kapanış projesinde bir video üretim modeline entegre edilerek doğrulandı.
Yüksek seviyeli CuTe soyutlamaları yerine doğrudan ham CUDA ve PTX yönergelerinin tercih edildiği proje; tcgen05 tensör çekirdeği komutları, SMEM ve TMEM bellek düzenleri ile çevrim içi softmax güncellemelerini detaylandırıyor. Çalışmanın kaynak kodları açık kaynak olarak paylaşıldı.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.