跳到主要内容

MUSA SDK v4.3.6 发布版本信息

下载链接

发布说明

MUSA SDK v4.3.6 正式发布。本版本在 mcc 编译器、MUSA 驱动与运行时、MCCL、muDNN 以及 Triton 等方面均有更新;支持平台为 Intel + Ubuntu 22.04,兼容 GPU 为 S4000、S5000。

测试平台

CPUOS内核版本测试环境mtbios项目
Intel x86_64Ubuntu 22.04.x LTS5.15.0-105-genericIntel + Ubuntu 22.04 + S50004.3.38-

产品说明

摩尔线程 MUSA SDK 是一套完整的 GPU 并行计算开发环境,专为利用摩尔线程 GPU 加速程序而设计。通过 MUSA SDK,您能够轻松地利用 GPU 加速各种应用,涵盖企业数据中心、桌面、工作站以及云平台和超级计算机等多个领域。该套件包括了 GPU 加速库、调试和优化工具、C/C++编译器以及用于应用程序部署的运行时库等功能。作为一套完整的开发工具,MUSA SDK 包含了以下主要组件:

  • MUSA Toolkits,包含底层编译器、MUSA 运行时库、Musify 工具以及MUSA-X 基础数学计算加速库
  • muDNN,MT GPU 深度学习加速库
  • MCCL,MT GPU 通信加速库
  • MUSA SDK 依赖于摩尔线程 GPU 和摩尔线程 GPU 通用驱动程序
  • MT GPU:MTT S5000, MTT S4000,MTT S3000,MTT S80, MTT X300 等
  • 通用驱动软件

功能描述

  • 支持 SIMT 架构并行编程模型
  • 提供 mcc 编译器工具链
  • MUSA 驱动与运行时库
  • 摩尔线程 MUSA 数学库 (muBLAS, muFFT, muPP, muRAND)
  • MCCL 通信库 (支持多 GPU 和多节点通信,优化 PCIe 和 MTLink 互联)
  • muDNN 深度学习加速库

主要更新

功能更新(Feature Updates)

mcc

  • 增加 sqmma commit_group / wait_group 软件支持,需保证 commit_group / wait_group 成对匹配(该特性无 NV 匹配的硬件支持,仅为软件优化手段,仅供内部使用)。
  • 增加 fp82f16、f162fp8、f2fp8 和 f162f32 的 burst 1/2/4 版本。
  • 扩展 kernel struct-byval 优化:支持 struct 单个成员变量满足 dword 对齐即可优化。
  • 解决编译器实现 bug 若干。

MUSA Driver & Runtime

  • 优化 graph 后处理延迟。
  • 优化 Invisible 设备资源占用。
  • 新增 muGraphExecChildGraphNodeSetParams API 支持。

MCCL

  • 优化 alltoall / sendrecv 双机带宽。
  • 优化单机 allreduce 带宽和延迟。
  • 升级支持 mccl-tests ace 测试。
  • 修复部分 ace reducescatter bug。
  • 修复部分初始化 dlopen 问题。

muDNN

  • GroupedMatMul 算子增加更多分块支持,优化性能与分块选择逻辑;默认关闭 multi-stream 调用模式。
  • BatchMatMul 算子增加更多分块支持,优化分块选择逻辑;小分块下支持 slicek;支持输入 batch 与 m 维度调换。
  • Unary 算子支持 uint64/uint32/uint16 数据类型的 cast 运算,uint64 数据类型的 identity 运算,int64 数据类型的 log 运算,并优化性能。
  • Permute 与 BatchNorm 算子优化小 shape 场景下性能。
  • Pooling 算子在 maxpool 模式下,前向与反向传播支持 float32 数据类型的索引。
  • 优化编译流程以节省运行过程中的显存占用。
  • 修复若干 bug 和问题。

Triton

  • import triton 不再依赖 torch。

兼容环境

  • Ubuntu 22.04.x LTS x86_64,内核版本 5.15.0-105-generic
  • 支持平台:Intel + Ubuntu 22.04
  • MT-GPU:S4000、S5000

产品组件说明

各安装包名称与版本号以 下载目录 内发布清单为准。