Moore Perf Compute 用户指南
前置要求
在开始使用 Moore Perf Compute 之前,请确保完成以下准备工作:
1. 安装 Moore Perf Compute
- 系统要求:Ubuntu 22.04 LTS(x86_64 或 AArch64)
- GPU 要求:摩尔线程 MUSA GPU(M1000、S4000、S5000)
- 依赖版本:Linux Driver 5.2.0、MUSA SDK 5.2.0
详细安装步骤参见安装指南。
2. 了解性能分析基础
建议先阅读性能分析文档,了解关键指标、分析方法和核心概念:
- Roofline 模型:理解计算受限与内存受限的区别
- Section 指标:LaunchStats、MemoryWorkloadAnalysis、SpeedOfLight
- 重放机制:为什么需要多次执行内核
注意
当前同一时间,同一个 GPU 上只能对一个进程进行数据收集。
使用指南
- 命令行界面 (CLI)
- 图形界面 (GUI)
命令行界面 (CLI)
Moore Perf Compute CLI(mcu)提供了从命令行分析 MUSA 应用程序的方法,目前仅支持 Linux 系统。
快速开始
本节提供快速入门指南,帮助你快速了解 mcu 的基本用法。
启动目标应用程序
命令行分析器会启动目标应用程序、插桩目标 API,并为指定的 kernel 收集性能分析结果。CLI 可执行文件名为 mcu,位于 Moore Perf Compute 安装目录下的 target-linux-x86_64 或 target-linux-aarch64 目录中。
要收集目标应用程序中所有 kernel launch 的指标,运行 :
mcu my_application
自定义数据收集
提供多种选项来指定应收集哪些 kernel 的数据:
-k, --kernel-name:通过 kernel 名称的正则匹配过滤 kernel。--devices:指定要分析的 GPU 设备。
当前默认收集所有 Section 中的指标。
输出报告文件
默认情况下,分析结果会同时输出到命令行和报告文件。指定 -o 可修改报告文件名;不指定则输出到默认文件 report#.mcu-rep:
mcu -o my_report my_application
使用模式
启动模式 (Launch Mode)
mcu 采用 Launch Only 模式,即在启动目标程序时进行性能分析。这种模式下,mcu 会:
- 启动目标应用程序
- 监控并拦截应用程序对 MUSA API 的调用
- 收集配置的性能指标
- 生成分析报告
典型的工作流程:
mcu [options] [application-arguments]