TrainingSuite 快速开始
本文以 v2.1.7 常规版为例,说明如何选择公网镜像、启动容器并确认实际的软件栈。其他版本请先查看版本对照。
1. 选择镜像
| 运行平台 | 镜像 | 使用边界 |
|---|---|---|
| 常规 x86 平台(Intel 场景) | registry.mthreads.com/mcctest/training-suite:v2.1.7 | 发布记录列出 MUSA SDK 4.3.8、PyTorch 2.7.1、torch_musa 2.7.1 |
| Hygon 平台 | registry.mthreads.com/mcctest/training-suite:v2.1.7_hygon | 独立平台标签;torch_musa 已适配,完整训练流程仍需按场景验证 |
两个公网标签均可查询到镜像清单。这里只表示 TrainingSuite 镜像已发布,不是独立 PyTorch base 镜像的发布清单。请不要把 Hygon 标签用于 Intel 宿主机,或反过来使用。
2. 拉取并启动
以下命令在 Docker 宿主机执行。根据宿主机 CPU 平台选择其一:
# 常规 x86 平台
docker pull registry.mthreads.com/mcctest/training-suite:v2.1.7
# Hygon 平台
docker pull registry.mthreads.com/mcctest/training-suite:v2.1.7_hygon
常规版启动示例:
docker run --rm -it \
--runtime=mthreads \
--privileged \
--network=host \
--shm-size=64g \
-e MTHREADS_VISIBLE_DEVICES=all \
registry.mthreads.com/mcctest/training-suite:v2.1.7 \
/bin/bash
在 Hygon 平台上运行时,将镜像 Tag 换成 v2.1.7_hygon。容器启动参数仍需与宿主机驱动、MUSA Container Toolkit 和实际资源配置匹配。
3. 验证实际环境
进入容器后执行:
mthreads-gmi
cat /usr/local/musa/version.json
python3 - <<'PY'
import torch
import torch_musa
print("PyTorch:", torch.__version__)
print("torch_musa:", torch_musa.__version__)
print("MUSA available:", torch.musa.is_available())
print("MUSA device count:", torch.musa.device_count())
PY
若镜像中没有 /usr/local/musa/version.json,请使用镜像实际提供的 SDK 版本查询文件或命令。文档列出的版本来自发布记录;实际安装版本以容器检查结果为准。
4. 下一步
- 返回 AI训练和推理首页,开始训练。
- 如果只需要 PyTorch 开发环境,不需要 TrainingSuite 的上层组件,请查阅 torch_musa 的独立镜像说明,再核对目标 Tag 的 SDK、CPU 平台和 PyTorch 版本。

