Skip to main content

MUSA SDK v4.3.3 发布版本信息

下载链接

发布说明

MUSA SDK v4.3.3 版本基于MUSA SDK 4.3.0分支进行功能迭代和问题修复,现已正式对内发布,具体支持平台以及对应项目见测试报告

测试平台

测试环境mtbiosCPUOS内核版本
Intel+Alinux host+Ubuntu Docker+S50004.3.27Intel(R) Xeon(R) Gold 6430Alibaba Cloud Linux 35.10.134-13.al8.x86_64
AMD+ubuntu22.04+S50004.3.27AMD EPYC 9T34 64-CoreUbuntu 22.04.4 LTS5.15.0-105-generic
Intel+Debian+S50004.3.27Intel(R) Xeon(R) Gold 6430Debian GNU/Linux 125.15.120-ve.3u1-amd64
Hygon4+Ubuntu24.04+S50004.3.27Hygon C86-4GUbuntu 22.04.4 LTS5.15.0-105-generic
Hygon4+Kylin(试用版)+S50004.3.29Hygon C86-4GKylin Linux Advanced Server V10 (GFB)4.19.90-52.23.v2207.gfb08.ky10.x86_64

产品说明

摩尔线程 MUSA SDK 是一套完整的 GPU 并行计算开发环境,专为利用摩尔线程 GPU 加速程序而设计。通过 MUSA SDK,您能够轻松地利用 GPU 加速各种应用,涵盖企业数据中心、桌面、工作站以及云平台和超级计算机等多个领域。该套件包括了 GPU 加速库、调试和优化工具、C/C++编译器以及用于应用程序部署的运行时库等功能。作为一套完整的开发工具,MUSA SDK 包含了以下主要组件:

  • MUSA Toolkits,包含底层编译器、MUSA 运行时库、Musify 工具以及MUSA-X 基础数学计算加速库
  • muDNN,MT GPU 深度学习加速库
  • MCCL,MT GPU 通信加速库
  • MUSA SDK 依赖于摩尔线程 GPU 和摩尔线程 GPU 通用驱动程序,需要运行在带有摩尔线程 GPU的服务器/工作站/PC 中,并安装了通用 Linux 驱动程序的环境中运行
  • MT GPU:MTT S5000, MTT S4000,MTT S3000,MTT S80, MTT X300 等
  • 通用驱动软件

另外 MUSA SDK 可配合摩尔线程提供的其他工具和软件提供更完整的 MUSA 计算功能

  • GMI&MTML 工具,可提供显卡的管理监控功能并带有 C 函数接口
  • 摩尔线程云原生套件,提供基于容器环境的 MUSA 计算并兼容 K8s 生态以及基于 RDMA 的GPU通信功能

功能描述

  • 支持 SIMT(Single Instruction Multiple Thread,SIMT)架构并行编程模型
  • 提供 MUSA 编程语言配套的编译器工具链 mcc,用于将 MUSA 应用程序源码编译为可以被 GPU识别的可执行文件
  • MUSA 驱动与运行时库,提供完整的基于 MT GPU 的MUSA 运行环境
  • 摩尔线程 MUSA 数学库提供了在 MT GPU 上优化过的数学函数库,包括
    • 基础线性代数算子库 muBLAS(MUSA Basic Linear Algebra Subprograms)
    • 快速傅里叶变换库 muFFT(MUSA Fast Fourier Transform)
    • 基础性能元库 muPP (MUSA Performance Primitives)
    • 随机数生成库 muRAND
  • MCCL 通信,针对摩尔线程 GPU 和网络进行性能优化的多 GPU 和多节点通信基元。 MCCL 提供了 all-gather、all-reduce、broadcast、reduce、reduce-scatter、point-to-point send 和 receive等原语,这些原语均经过优化,可通过节点内的 PCIe 和 MTLink 高速互联以及节点间的InfiniBand 网络实现高带宽和低延迟
  • muDNN 库,针对深度学习领域和人工智能模型算法优化的函数库,提供高度优化的数学和数据处理任务的函数,包括张量运算,神经网络层计算,损失函数计算等

主要更新

功能更新(Feature Updates)

  • VPU 支持

    • 新增对 VPU 的支持
    • 使用 VPU 需将 mtbios 升级至 4.3.30 及以上版本
  • GPU 压测能力增强(muDNN benchmark)

    • 支持通过 muDNNbenchmark 进行 GPU 压测
    • 新增环境变量控制执行超时时间:
      export MUSA_EXECUTION_TIMEOUT=<按需定义,单位 ms>
  • Hygon + Kylin V10 GFB 平台增强

    • 支持在 Hygon + Kylin V10 GFB 平台上的运行
    • 由于该 OS 不支持 dma_buff,需额外安装 peermem 组件以保证功能正常
  • Graph Capture & 多流支持

    • 针对 SGLang / 蚂蚁场景的 graph capture multistream 能力进行增强,提升多流图捕获的稳定性与兼容性(修复相关 abort 问题)
  • 中断管理能力优化

    • 支持 PH1 平台 mt-link IRQ mask 重配置,提升中断管理与资源隔离能力
  • MCU 功能恢复与兼容性提升

    • 在最新 DDK 与 mtbios 版本组合下,对 MCU 使用流程进行修正与兼容性增强,保障 MCU 可正常使用
  • 内存传输链路优化

    • Master / release_musa_4.3.0 / PH1 场景下优化 memory transfer node 的执行路径
    • 支持按场景合理选择 CE / shader 执行路径,提升传输效率与资源利用率
  • MuPTI 能力增强

    • MuPTI 新增 muptiFinalize 接口
    • 支持对 Profiling/Tracing 生命周期进行显式收尾与资源释放,方便集成与自动化工具使用
  • Flash Attention 算法能力扩展

    • 在 KUAE 场景中,Flash Attention 算子新增对 head dim = 256 训练场景的支持
    • 扩展大模型场景下多头注意力的配置空间
  • 算子与内核能力完善

    • Permute Kernel
      • 优化 permute kernel 在端到端场景下的计算正确性,保证与单测结果一致
    • FA 算子精度
      • 针对 FA(Flash Attention 相关)算子进行精度优化与修正,提升数值稳定性和收敛表现
  • Graph / 通信相关能力增强

    • MCCL Graph 场景稳定性
      • 优化 mccl-test graphmccl_cts API 等场景下的 Graph 模式运行稳定性和错误处理机制,改善大规模分布式任务下的体验

兼容环境

见测试报告

产品组件说明

MUSA SDK组件

包名称版本
mccl_rc2.1.3.PH1.tar.gz2.1.3
mt-peermem_1.3_amd64.deb1.3
mudnn_rc3.1.3.PH1.tar.gz3.1.3
musa_3.3.3-server_amd64.deb3.3.3
musa_toolkits_rc4.3.3.tar.gz4.3.3
triton_rc1.4.3_py311.tar.gz1.4.3
79e98a02a_mtml_2.2.0-linux-R_amd642.2.0
ComputeBenchmark.tar.gz-
e17b1fb50_moore-perf-system_1.5.0_x86_641.5.0
e17b1fb50_moore-perf-system_1.5.0_x86_64_internal1.5.0
mt-datacenter-gpu-manager_amd64_v1.1.0_95e325db31.1.0