Ana içeriğe geç
Donanım

GPU bellek okuma sürecinin donanım adımları tersine mühendislikle incelendi

Öne çıkanlar

  • RTX 4090 üzerinde L1 önbellek isabeti yaklaşık 40 döngü, L2 önbellek isabeti ise 330 döngü sürüyor.
  • L1 ıskalaması sonrası adres çevirisi SM içindeki TLB üzerinden donanım düzeyinde yapılıyor.
  • DRAM seviyesine kadar inen tam bir bellek yükleme döngüsü yaklaşık 255 nanosaniyede tamamlanıyor.

Doubleword ekibi, bir grafik işlemcisinin (GPU) global bellekten veri okuma sürecinde yürüttüğü donanım adımlarını Nvidia RTX 4090 üzerinde gerçekleştirdiği zamanlama deneyleriyle inceledi. Basit bir vektör toplama çekirdeğinde yer alan küresel yükleme komutunun (LDG.E) yazmaçlardan başlayıp fiziksel DRAM hücrelerine kadar izlediği yol analiz edildi.

Araştırma, 32 iş parçacığından oluşan bir warp kümesinin bellek isteğinin öncelikle birleştirici (coalescer) tarafından 32 baytlık sektörlere dönüştürüldüğünü gösterdi. Sanal adres kullanan L1 önbelleğindeki ıskalama yaklaşık 40 döngü (15,4 nanosaniye) sürerken, SM içerisindeki adres çeviri birimi (TLB) aracılığıyla fiziksel adrese dönüştürülen istek bağlantı ağı (crossbar) üzerinden L2 dilimlerine iletildi. L2 önbellek erişiminin ise 330 döngü (127 nanosaniye) civarında tamamlandığı saptandı.

L2 önbelleğinde de bulunamayan veriler için bellek denetleyicisinin GDDR6X yongasına eriştiği aktarıldı. DRAM hücrelerindeki satır açma (activate) ve sütun okuma işlemlerinin ardından verinin PAM4 sinyalleriyle iletildiği ve L1, TLB, L2 ile DRAM döngüsünü kapsayan gidiş-dönüş süresinin yaklaşık 255 nanosaniye (660 döngü) sürdüğü kaydedildi. Bu süre boyunca bekleyen warp kümesi, verinin yazmaçlara yazılmasıyla bağımlılık engelini aşarak sıradaki toplama işlemine geçti.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.