Skip to main content

MUSA SDK v4.3.8 发布版本信息

下载链接

MTT S5000

  • 下载链接
  • 支持操作系统:
    • Alibaba Cloud Linux 3
    • VesselOS 2.0 (LTS-SP2)
    • Kylin Linux Advanced Server V10
    • Ubuntu 22.04.4 LTS

发布说明

MUSA SDK v4.3.8 版本基于 MUSA SDK 4.3.0 分支进行功能迭代和问题修复,在 4.3.6 基础上持续优化大模型训练与推理性能、完善 DeepEP 多机通信能力,并进一步提升系统稳定性与易用性,现已正式发布。

本版本已完成多平台发布测试,CTS 无新增问题,模型训练与推理性能达标。部分专项测试存在已知问题,评估为不影响本次版本发布,作为 Open Issue 后续跟踪。

具体支持平台详见下方列表。

支持平台

MTT S5000支持平台

CPUOS内核版本MUSA SDK包
IntelAlibaba Cloud Linux 35.10.134-13.al8.x86_64RPM
VesselOS 2.0 (LTS-SP2)6.6.0-100.jd_b007.x86_64RPM
AMDUbuntu 22.04.4 LTS5.15.0-105-genericDEB
HygonKylin Linux Advanced Server V10 (Halberd)4.19.90-89.11.v2401.ky10.x86_64RPM

产品说明

摩尔线程 MUSA SDK 是一套完整的 GPU 并行计算开发环境,专为利用摩尔线程 GPU 加速程序而设计。通过 MUSA SDK,您能够轻松地利用 GPU 加速各种应用,涵盖企业数据中心、桌面、工作站以及云平台和超级计算机等多个领域。该套件包括了 GPU 加速库、调试和优化工具、C/C++编译器以及用于应用程序部署的运行时库等功能。作为一套完整的开发工具,MUSA SDK 包含了以下主要组件:

  • MUSA Toolkits,包含底层编译器、MUSA 运行时库、Musify 工具以及MUSA-X 基础数学计算加速库
  • muDNN,MT GPU 深度学习加速库
  • MCCL,MT GPU 通信加速库
  • MUSA SDK 依赖于摩尔线程 GPU 和摩尔线程 GPU 通用驱动程序
  • MT GPU:MTT S5000, MTT S4000,MTT S3000,MTT S80, MTT X300 等
  • 通用驱动软件

功能描述

  • 支持 SIMT 架构并行编程模型
  • 提供 mcc 编译器工具链
  • MUSA 驱动与运行时库
  • 摩尔线程 MUSA 数学库 (muBLAS, muFFT, muPP, muRAND)
  • MCCL 通信库 (支持多 GPU 和多节点通信,优化 PCIe 和 MTLink 互联)
  • muDNN 深度学习加速库

主要更新

功能更新(Feature Updates)

  • 编译器与工具链增强(mcc)

    • 修复若干编译器实现问题,解决部分场景下的编译报错问题
  • 运行时与驱动优化(Driver/Runtime & KMD)

    • 修复 musaStreamWaitEvent 在特定场景下的误报超时问题
    • 优化异常处理上报时的队列(queue)污染逻辑,细化异常定位
    • 驱动适配 MTBIOS EDC 新接口
    • 增强 MUSA Snapshot 内存转储功能
    • 修复大模型微调训练场景下偶发的 GPU firmware hangs 问题
    • 修复服务器偶发重启的问题
  • 通信能力增强(MCCL & DeepEP)

    • 新增 DeepEP V1 Internode low-latency 模式对 topk 16 / 896 experts 场景的支持,并扩展对 768 experts 规模场景的支持
    • 修复 DeepEP 单机内 dispatch 通信与双机互联场景下的通信报错问题
    • 修复 DeepEP internode combine 异常与 low-latency kernel timeout 问题
    • 修复多机 alltoall 通信在特定场景下带宽骤降的问题
    • 修复 MTSHMEM 性能测试场景失败的问题
  • 算子与框架支持增强(muDNN & FlashAttention)

    • 新增 causal 模式下 FlashAttention deterministic 特性支持
    • FlashAttention Varlen Forward/Backward 通过 MATE 提供接口,兼容 FA3 接口
    • 修复 varlen FA 反向计算在特定场景下出现 NaN 的问题
    • 修复 torch.logsumexp 输入全为 -inf 时输出 NaN 的问题
    • 修复部分模型使用 muDNN 后出现的性能回退问题
    • 规范 muDNN kernel 的 stream 使用
    • 修复部分大模型推理性能回退与性能空泡问题
    • 修复长序列推理场景下的非法地址访问问题
  • 推理与训练框架支持(vLLM & sglang & 强化学习)

    • 修复 sglang 推理场景下大模型吞吐性能下降的问题
    • 修复 vLLM 多卡推理服务启动报错与编译报错问题
    • 修复强化学习训练场景下偶发的显存不足(OOM)问题
    • 修复部分大模型训练性能波动与下降的问题
    • 修复交叉兼容场景下的运行时报错问题
  • 监控与运维工具增强(DCGM/GMI/MTML)

    • DCGM 支持通过软件故障注入方式生成 XID 异常,便于异常场景测试与验证
    • 修复 dcgm-exporter 启用 PFM 监控或配置变更时触发的 GPU-FW hang / MMU Core fault 问题
    • 修复 dcgmi dmon 监控 PFM 相关字段显示为 n/a 的问题
    • 修复 DCGM 新增监控项开启后导致大模型训练性能波动的问题
    • 优化进程级别 GPU 利用率刷新效率,利用率数值之和不超过 100%
    • 修复 GMI 查询 GPU UUID 为全 0 及 GPU 负载显示异常的问题
    • 修复 mthreads-gmi 操作导致服务器重启的问题

产品组件说明

具体包名称与版本信息请以开发者官网对应版本下载页为准。