MUSA C++ 语法
本指南面向编写 GPU 内核(kernel)的开发者,覆盖 MUSA C++ 的设备端代码(Device Code)语法、并行原语、低精度类型、Tensor 指令和异步数据搬运。
MUSA C++ 语法概述
从编程模型到 API 代码的桥梁
MUSA C++ 语言扩展
MUSA C++ 语法扩展——函数限定符、内置变量、核函数配置
原子函数
MUSA 原子函数——全局内存、共享内存、系统范围的原子操作
Warp 函数
MUSA Warp 函数——线程束同步、投票操作、数据交换
数学函数与低精度类型
MUSA Device Code 数学函数、低精度类型、转换和精度选择
Tensor 编程:MP31 TCE、WMMA、SQMMA 与 TME
使用 MTCC MP31 TCE/TME builtin 组织 Tensor Core kernel
TME/TCE API Reference - MP31
MTCC MP31 TCE、TME、barrier builtin 与参数参考
TME 与异步数据搬运(MP31)
MTCC MP31 TME、barrier 和 pipeline 的异步数据搬运规则
Cooperative Groups
MUSA Cooperative Groups 的线程组、同步、规约、扫描和通用异步搬运
与编程模型的关系
本部分是 编程模型 的代码实现层:
| 编程模型概念 | 对应语法/API |
|---|---|
| 线程层次 | threadIdx, blockIdx, <<<grid, block>>> |
| 内存层次 | __shared__, musaMalloc, musaMemcpy |
| 执行模型 | __syncthreads(), __syncwarp() |
| 主机/设备模型 | Runtime API、Driver API |

