跳到主要内容

TrainingSuite 快速开始

本文以 v2.1.2 为例,说明如何选择公网镜像、启动容器并确认实际的软件栈。其他版本请先查看版本对照。

1. 选择镜像​

运行平台镜像使用边界
x86_64 平台registry.mthreads.com/mcctest/ai/training-suite:v2.1.2仅支持 x86_64 和 Ubuntu 22.04;发布资料列出 MUSA SDK 4.3.5,未注明 PyTorch 和 torch_musa 版本。

没有提供 Hygon 镜像。镜像标签存在只表示镜像已经发布,不代表所有模型和训练配置均已验证。

2. 拉取并启动​

以下命令在 Docker 宿主机执行:

docker pull registry.mthreads.com/mcctest/ai/training-suite:v2.1.2

启动交互式容器:

docker run --rm -it \
--runtime=mthreads \
--privileged \
--network=host \
--shm-size=64g \
-e MTHREADS_VISIBLE_DEVICES=all \
registry.mthreads.com/mcctest/ai/training-suite:v2.1.2 \
/bin/bash

容器启动参数需要与宿主机驱动、MUSA Container Toolkit 和实际资源配置匹配。请使用完整镜像地址,不要替换为其他版本的仓库路径或标签。

3. 验证实际环境​

进入容器后执行:

mthreads-gmi
cat /usr/local/musa/version.json
python3 - <<'PY'
import torch
import torch_musa

print("PyTorch:", torch.__version__)
print("torch_musa:", torch_musa.__version__)
print("MUSA available:", torch.musa.is_available())
print("MUSA device count:", torch.musa.device_count())
PY

若镜像中没有 /usr/local/musa/version.json,请使用镜像实际提供的 SDK 版本查询文件或命令。文档列出的版本来自发布资料;实际安装版本以容器检查结果为准。

4. 下一步​