Ana içeriğe geç
Yapay Zeka

FlashAttention GPU bellek trafiğini azaltarak Transformer modellerini hızlandırıyor

Öne çıkanlar

  • FlashAttention, N kare boyutundaki ara matrisleri HBM belleğine yazmayarak veri aktarım maliyetini düşürüyor.
  • Çevrim içi softmax tekniği, tüm dizi görülmeden ara blokların tam sayısal kararlılıkla normalleştirilmesini sağlıyor.
  • Algoritma bir yaklaşım yöntemi kullanmıyor; klasik dikkat fonksiyonunu matematiksel olarak tam ve kesin hesaplıyor.

Yayımlanan teknik rehber, Transformer mimarilerinde standart dikkat mekanizmasının GPU donanımında yarattığı bellek darboğazını ve FlashAttention algoritmasının getirdiği çözümü ele aldı. Geleneksel dikkat hesaplaması, ara skor ve olasılık matrislerini sürekli yüksek bant genişlikli belleğe (HBM) yazıp oradan okuyor. Bu durum, 8192 dizi uzunluğundaki tek bir örnek için 4 GB büyüklüğünde ara matrislerin HBM üzerinde defalarca taşınmasına ve ciddi bir veri aktarımı gecikmesine yol açıyor.

FlashAttention, hesaplama karmaşıklığını değiştirmeden bu darboğazı döşeme (tiling), çevrim içi softmax ve yeniden hesaplama teknikleriyle aşıyor. Sorgu, anahtar ve değer tensörlerini GPU'nun çip üzeri hızlı paylaşımlı belleğine (SRAM) sığacak bloklara ayıran algoritma, tam dikkat matrisini HBM'e hiç yazmadan çıktı üretiyor. Çevrim içi softmax mekanizması sayesinde satır bazlı istatistikler ve maksimum değerler dinamik olarak güncelleniyor, böylece ara adımların küresel matris olarak saklanma zorunluluğu ortadan kalkıyor.

Rehber, algoritmanın yoğun dikkat fonksiyonunu yaklaşık değil birebir kesin olarak hesapladığını vurguluyor. FlashAttention, işlemci çekirdeklerinin aritmetik operasyon miktarını (FLOP) azaltmak yerine donanım bellek hiyerarşisine duyarlı bir veri akış çizelgesi uyguluyor. Bu tasarım, bellek aktarım trafiğini asgariye indirerek modern yapay zeka hızlandırıcılarında işlem süresini belirgin biçimde kısaltıyor.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.