跳转至主要内容
回到顶部
Ctrl
+
K
搜索
Ctrl
+
K
第一部分:理解 GPU
GPU 执行模型
Kernel 性能从何而来
数据布局及其记号
Tensor Core 数据布局的演进
异步数据搬运:TMA
Blackwell Tensor Core:
tcgen05.mma
Tensor Memory(TMEM)
异步协作:mbarrier
进阶调度:Cluster Launch Control
第二部分:TIRx 概览
TIRx 入门
TIRx Layout API
第三部分:GEMM:从 Tiled 到 SOTA
构建 Tiled GEMM
使用 TMA 为 GEMM 建立 Pipeline
使用 Warp Specialization 和 Cluster 扩展 GEMM
第四部分:Flash Attention 4
Flash Attention 4
附录
概览
TIRx 语言参考
Parser 工具
数据类型与表达式
Buffer 与内存
控制流
CUDA C++/PTX Intrinsics
GPU Kernel 性能测量与分析
编译器内部机制
TIRx 编译流水线
调试 Warp-Specialized Kernels
System Settings
亮色
暗色
索引