TrainingSuite 快速开始
本文以 v2.1.5 为例,说明如何选择公网镜像、启动容器并确认实际的软件栈。其他版本请先查看版本对照。
1. 选择镜像
| 运行平台 | 镜像 | 使用边界 |
|---|---|---|
| x86_64 平台 | registry.mthreads.com/mcctest/ai/training-suite:v2.1.5 | 仅支持 x86_64 和 Ubuntu 22.04;对应 MUSA SDK 4.3.5 和 torch_musa 2.7.1。 |
没有提供 Hygon 镜像。镜像标签存在只表示镜像已经发布,不代表所有模型和训练配置均已验证。
2. 拉取并启动
以下命令在 Docker 宿主机执行:
docker pull registry.mthreads.com/mcctest/ai/training-suite:v2.1.5
启动交互式容器:
docker run --rm -it \
--runtime=mthreads \
--privileged \
--network=host \
--shm-size=64g \
-e MTHREADS_VISIBLE_DEVICES=all \
registry.mthreads.com/mcctest/ai/training-suite:v2.1.5 \
/bin/bash
容器启动参数需要与宿主机驱动、MUSA Container Toolkit 和实际资源配置匹配。请使用完整镜像地址, 不要替换为其他版本的仓库路径或标签。
3. 验证实际环境
进入容器后执行:
mthreads-gmi
cat /usr/local/musa/version.json
python3 - <<'PY'
import torch
import torch_musa
print("PyTorch:", torch.__version__)
print("torch_musa:", torch_musa.__version__)
print("MUSA available:", torch.musa.is_available())
print("MUSA device count:", torch.musa.device_count())
PY
若镜像中没有 /usr/local/musa/version.json,请使用镜像实际提供的 SDK 版本查询文件或命令。文档列出的版本来自发布资料;实际安装版本以容器检查结果为准。
4. 下一步
- 返回 AI训练和推理首页,开始训练。
- 如果只需要 PyTorch 开发环境,不需要 TrainingSuite 的上层组件,请查阅 torch_musa 的独立镜像说明,再核对目标标签的 SDK、CPU 平台和 PyTorch 版本。

