摩尔线程云原生套件 v1.9.0 发布说明
版本说明
摩尔线程云原生套件(MT Cloud Native Toolkits)v1.9.0 版本,包含主要产品组件版本 MT Container Toolkits v1.9.0 和 MT GPU Operator v1.4.0。
产品说明
摩尔线程开发并提供摩尔线程云原生套件,使能摩尔线程全功能 GPU 于云原生技术及 Kubernetes 系统。
云原生套件包含两个主要的产品组件,分别是 MT Container Toolkits 和 MT GPU Operator。
MT Container Toolkits 功能上为通过摩尔线程开发的内容对接容器运行时,runc、rkt、imctfy 等,使得容器在启动时刻,可以将主机端的驱动程序和设备节点挂载到容器中。容器中不用另外处理关于设备的内容就就可以直接使用 GPU 设备进行计算。这样容器镜像可以保持为设备无关且无状态的属性,容器中的内容只关注于业务本身,便于后期的灵活扩展和跨设备,跨节点的技术特性。
Kubernetes 通过设备插件框架提供对特殊硬件资源(例如 MT GPU 和其他设备)的访问。然而,使用这些硬件资源配置和管理节点需要配置多个软件组件,例如驱动程序、容器运行时或其他函数库,配置的过程较为复杂且容易出错。 MT GPU Operator 使用 Kubernetes 内的 Operator 框架来自动管理配置 GPU 所需的所有软件组件。这些组件包括 GPU 驱动程序、GPU 的 Kubernetes 设备插件、MT 容器运行时、自动节点标记、监控等
功能描述
平台支持
支持 linux 发行版
| 操作系统名称及版本 | amd64 / x86_64 | arm64 / aarch64 |
|---|---|---|
| Ubuntu 20.04 | Y | |
| Kylin V10 SP1 | Y | |
| UnionTech OS Desktop 20 Pro | Y |
支持的容器运行时
| 容器运行时名称及版本 | amd64 / x86_64 | arm64 / aarch64 |
|---|---|---|
| Docker 20.10 | Y | Y |
| containerd 1.5 | Y | Y |
| CRI-O 1.32.5 | Y | Y |
GPU 支持列表
MTT S4000、MTT S3000、MTT S80、MTT S2000、MTT S1000
主要功能描述
容器运行时(MT Cloud Native Toolkits)
- 容器运行时支持容器内无需安装 GPU 驱动程序直接使用 GPU
- 容器化支持 GPU 渲染,渲染功能同 MT Linux Driver
- 容器化支持 GPU 编解码,渲染功能同 MT Linux Driver
- 容器化支持 GPU 计算,计算功能同 MUSA SDK 版本,推荐 MUSA SDK rtm1.5.2
- 容器运行时可配置容器使用 GPU 数量,包括全部使用、部分使用(按照 GPU 索引选择或 GPU 的 UUID 选择)、不使用
- 容器运行时可配置容器使用 GPU 能力,包括 compute、graphics、utility 和 video 四种能力的组合搭配
- 动态配置容器内使用驱动能力
- 支持物理 GPU 和虚拟 GPU
- sGPU 支持以多容器共享物理 GPU 的使用方式下,对容器占用的 GPU 算力、显存等资源进行固定划分并可以动态扩展缩小占用比例,实现容器化的弹性 GPU 计算
MT GPU Operator
- 支持 clusterpolicy cr 来控制需要自动部署的组件,包括以下组件 mt-driver-toolkit、mt-aiops、mt-container-toolkit、mt-universal-gpu-device-controller、mt-gpu-export、mt-gpu-feature-discovery、mt-gpu-webhook、mt-gpushare-scheduler、kured、node-feature-discovery、node-problem-detector、mt-operator-validator 等
- 支持 mt-container-toolkit 在 k8s 节点上的自动安装
- 支持 k8s 节点上 的 MT 驱动和 container runtime 验证
- 支持 Node feature discovery 自动安装并为 k8s 节点打出节点特性标签
- 支持 GPU feature discovery 自动安装,并在 k8s 节点上打上 gpu 型号和 sgpu 特性的相关标签
- CR clusterconfig 用于动态配置节点上的驱动和设备能力,指定集群中各 gpu 能力比例
- 支持 MT gpu device-plugin 和 mt gpu admision 的自动安装,k8s 集群中的 gpu 设备和 sgpu 设备可以被正常使用
- 支持 MT gpu exporter,方便监控节点上 gpu 指标
- 支持 aiops 和 node problem detector 的自动安装,匹配已知 gpu 故障日志实现自动化运维
- 支持 MT 的三种 GPU 设备类型,sGPU、GPU、GPU Passthrough
- 支持 kubevirt 下使用 gpu passthrough 设备
- clusterconfig 支持热更新
- clusterpolicy 支持为 driver-toolkit 设置 dnsPolicy,方便集群内部驱动下载
- clusterconfig 支持 sgpu 细致化配置:可以指定卡能支持的最大容器数量 max_inst、可以指定当前卡显存申请时的超发比例 overcommit_ratio、可以指定当前卡的算力隔离模式 policy
- mt-gpu-scheduler 支持 sgpu 超发
- mt-gpu-scheduler 支持多卡调度
产品组件说明
文件描述
| 组件名称 | 版本 | 组件说明 |
|---|---|---|
| mt-container-toolkit_1.9.0-1_amd64.deb | 1.9.0 | MT GPU 容器运行时 |
| sgpu-dkms_1.2.1_amd64.deb | 1.2.1 | MT 弹性 GPU 驱动程序 |
| 7cf757237_mtml_1.9.2-linux-R_amd64.deb | 1.9.2 | GPU 管理监控函数库 |
| 摩尔线程容器运行时套件安装说明文档_1.9.0.md | 1.9.0 | 安装说明文档 |
| mt-gpu-operator-1.4.0.tgz | 1.4.0 | MT GPU Operator 软件包 |
| mt-gpu-operator-custom-resources-1.4.0.tgz | 1.4.0 | MT GPU Operator Custom Resources 包 |
| mt-gpu-operator.yaml | mt-gpu-operator yaml 文件 | |
| mthreads_v1alpha4_clusterconfig.yaml | clusterconfig yaml 文件 | |
| mthreads_v1beta1_clusterpolicy.yaml | clusterpolicy yaml 文件 | |
| install.sh | MTGPU Operator 部署脚本 |

