MT GPU Operator 安装指南
MT GPU Operator 是摩尔线程提供的 Kubernetes GPU 管理组件,用于在 Kubernetes 集群中管理和使用摩尔线程 GPU 设备。本文档介绍支持平台、安装模式及操作步骤,包括 DCGM 及 DCGM Exporter 的容器化安装。
硬件及平台支持
GPU、MUSA SDK 支持列表参考 MT Container Toolkit 安装指南。
CPU 及 OS 支持
| CPU | OS |
|---|---|
| Intel | Ubuntu 22.04 |
| Intel | Alibaba Cloud Linux 3 (Soaring Falcon) |
| Intel | Debian 12 |
| AMD64 | Ubuntu 22.04 |
| Hygon4 | Ubuntu 22.04 |
| Hygon4 | Kylin V10/V11 |
系统依赖组件
-
Kubernetes 1.19 ~ 1.32。
-
如使用 GPU Operator Core 安装模式,参考 MT Container Toolkit 安装指南 安装 Container Toolkit。
-
如使用 GPU Operator Full 安装模式,会自行安装 Container Toolkit。
GPU Operator 安装模式
MT GPU Operator 提供两种安装模式,以适应不同的使用场景:
| 模式 | 描述 | 适用场景 |
|---|---|---|
| Core | 只包含 Device Plugin 和 DCGM,暴露 GPU 为可调度资源并提供基础监控能力。 | 最大化手动控制或利用已有的自动化管理平台。 需要预装驱动和容器运行时。 高级功能手动配置,节点扩容手动更新。 轻量部署,资源开销小。 |
| Full | 包含 MT GPU Operator 的全部功能,提供完整的 GPU 管理和监控能力。 | GPU 全栈自动化部署、配置与生命周期管理。 需要自动化的驱动部署与升级。 需要 GPU 调度器、sGPU 等高级功能自动配置。 部署较复杂,资源开销较高。 |
先决条件
在安装 MT GPU Operator 前,您应该确保 Kubernetes 集群满足以下先决条件:
- Prometheus 监控:要在 Kubernetes 中收集 GPU 使用数据,必须在集群中部署 Prometheus。
$ export VERSION=$(curl -s https://api.github.com/repos/prometheus-operator/prometheus-operator/releases | grep tag_name | grep -v -- '-rc' | grep -v -- '-alpha' | sort -r | head -1 | awk -F': ' '{print $2}' | sed 's/,//' | xargs)
$ echo $VERSION
$ kubectl create -f https://github.com/prometheus-operator/prometheus-operator/releases/download/${VERSION}/bundle.yaml
- 驱动自动安装依赖包:对于 Full 安装模式,支持自动安装 GPU 驱动程序,必须在集群内的每个节点上手动安装以下软件包。对于 Core 安装模式请忽略此项。
- LightDM 是一个跨桌面显示管理器,可以使用以下命令进行安装:
$ sudo apt install -y lightdm
- libdrm2 是内核直接渲染管理器 (DRM) 服务的用户空间接口,可以使用以下命令进行安装:
$ sudo apt install -y libdrm2
注意:libdrm2 所需的最低版本是
2.4.99。