TMA:从 Global Memory 搬到 Shared Memory

一个 warp 中的一个 thread 提交 2D copy,TMA engine 搬运整个 tile,并可在写入时应用 swizzle
Swizzle
Row offset
Col offset

Global Memory

16×128 fp16(每个 cell = 16B = 1×8 fp16)
TMA Engine
数据搬运引擎
cp.async.bulk.tensor.2d
+ SWIZZLE_128B

Shared Memory

8×8 sectors (swizzled)