MUSA C++ 语法
本指南面向编写 GPU 内核(kernel)的开发者,介绍 MUSA C++ 的设备端代码(Device Code)语法、并行原语、低精度类型、Tensor 指令和异步数据搬运。
MUSA C++ 语法概述
从编程模型到 API 代码的桥梁
MUSA C++ 语言扩展
MUSA C++ 语法扩展——函数限定符、内置变量、核函数配置
原子函数
MUSA 原子函数——全局内存、共享内存、系统范围的原子操作
Warp 函数
MUSA Warp 函数——线程束同步、投票操作、数据交换
数学函数与低精度类型
MUSA Device Code 数学函数、低精度类型、转换和精度选择
Tensor 编程
面向 S5000(编译目标 `mp_31`)的 Tensor / TME 编程入口与开发指南
TME/TCE API 参考
S5000(编 译目标 `mp_31`)的 TCE、TME 和 descriptor API 参考
协作组
MUSA 协作组的线程组、同步、归约、扫描和通用异步搬运
与编程模型的关系
本部分是 编程模型 的代码实现层:
| 编程模型概念 | 对应语法/API |
|---|---|
| 线程层次 | threadIdx, blockIdx, <<<grid, block>>> |
| 内存层次 | __shared__, musaMalloc, musaMemcpy |
| 执行模型 | __syncthreads(), __syncwarp() |
| 主机/设备模型 | Runtime API、Driver API |

