跳到主要内容

摩尔线程云原生套件 v1.9.0 发布说明

版本说明

摩尔线程云原生套件(MT Cloud Native Toolkits)v1.9.0 版本,包含主要产品组件版本 MT Container Toolkits v1.9.0 和 MT GPU Operator v1.4.0。

产品说明

摩尔线程开发并提供摩尔线程云原生套件,使能摩尔线程全功能 GPU 于云原生技术及 Kubernetes 系统。

image

MT Cloud Native Toolkits 框架图

云原生套件包含两个主要的产品组件,分别是 MT Container Toolkits 和 MT GPU Operator。

MT Container Toolkits 功能上为通过摩尔线程开发的内容对接容器运行时,runc、rkt、imctfy 等,使得容器在启动时刻,可以将主机端的驱动程序和设备节点挂载到容器中。容器中不用另外处理关于设备的内容就就可以直接使用 GPU 设备进行计算。这样容器镜像可以保持为设备无关且无状态的属性,容器中的内容只关注于业务本身,便于后期的灵活扩展和跨设备,跨节点的技术特性。

Kubernetes 通过设备插件框架提供对特殊硬件资源(例如 MT GPU 和其他设备)的访问。然而,使用这些硬件资源配置和管理节点需要配置多个软件组件,例如驱动程序、容器运行时或其他函数库,配置的过程较为复杂且容易出错。 MT GPU Operator 使用 Kubernetes 内的 Operator 框架来自动管理配置 GPU 所需的所有软件组件。这些组件包括 GPU 驱动程序、GPU 的 Kubernetes 设备插件、MT 容器运行时、自动节点标记、监控等

功能描述

平台支持

支持 linux 发行版

操作系统名称及版本amd64 / x86_64arm64 / aarch64
Ubuntu 20.04Y
Kylin V10 SP1Y
UnionTech OS Desktop 20 ProY

支持的容器运行时

容器运行时名称及版本amd64 / x86_64arm64 / aarch64
Docker 20.10YY
containerd 1.5YY
CRI-O 1.32.5YY

GPU 支持列表

MTT S4000、MTT S3000、MTT S80、MTT S2000、MTT S1000

主要功能描述

容器运行时(MT Cloud Native Toolkits)

  1. 容器运行时支持容器内无需安装 GPU 驱动程序直接使用 GPU
  2. 容器化支持 GPU 渲染,渲染功能同 MT Linux Driver
  3. 容器化支持 GPU 编解码,渲染功能同 MT Linux Driver
  4. 容器化支持 GPU 计算,计算功能同 MUSA SDK 版本,推荐 MUSA SDK rtm1.5.2
  5. 容器运行时可配置容器使用 GPU 数量,包括全部使用、部分使用(按照 GPU 索引选择或 GPU 的 UUID 选择)、不使用
  6. 容器运行时可配置容器使用 GPU 能力,包括 compute、graphics、utility 和 video 四种能力的组合搭配
  7. 动态配置容器内使用驱动能力
  8. 支持物理 GPU 和虚拟 GPU
  9. sGPU 支持以多容器共享物理 GPU 的使用方式下,对容器占用的 GPU 算力、显存等资源进行固定划分并可以动态扩展缩小占用比例,实现容器化的弹性 GPU 计算

MT GPU Operator

  1. 支持 clusterpolicy cr 来控制需要自动部署的组件,包括以下组件 mt-driver-toolkit、mt-aiops、mt-container-toolkit、mt-universal-gpu-device-controller、mt-gpu-export、mt-gpu-feature-discovery、mt-gpu-webhook、mt-gpushare-scheduler、kured、node-feature-discovery、node-problem-detector、mt-operator-validator 等
  2. 支持 mt-container-toolkit 在 k8s 节点上的自动安装
  3. 支持 k8s 节点上 的 MT 驱动和 container runtime 验证
  4. 支持 Node feature discovery 自动安装并为 k8s 节点打出节点特性标签
  5. 支持 GPU feature discovery 自动安装,并在 k8s 节点上打上 gpu 型号和 sgpu 特性的相关标签
  6. CR clusterconfig 用于动态配置节点上的驱动和设备能力,指定集群中各 gpu 能力比例
  7. 支持 MT gpu device-plugin 和 mt gpu admision 的自动安装,k8s 集群中的 gpu 设备和 sgpu 设备可以被正常使用
  8. 支持 MT gpu exporter,方便监控节点上 gpu 指标
  9. 支持 aiops 和 node problem detector 的自动安装,匹配已知 gpu 故障日志实现自动化运维
  10. 支持 MT 的三种 GPU 设备类型,sGPU、GPU、GPU Passthrough
  11. 支持 kubevirt 下使用 gpu passthrough 设备
  12. clusterconfig 支持热更新
  13. clusterpolicy 支持为 driver-toolkit 设置 dnsPolicy,方便集群内部驱动下载
  14. clusterconfig 支持 sgpu 细致化配置:可以指定卡能支持的最大容器数量 max_inst、可以指定当前卡显存申请时的超发比例 overcommit_ratio、可以指定当前卡的算力隔离模式 policy
  15. mt-gpu-scheduler 支持 sgpu 超发
  16. mt-gpu-scheduler 支持多卡调度

产品组件说明

文件描述

组件名称版本组件说明
mt-container-toolkit_1.9.0-1_amd64.deb1.9.0MT GPU 容器运行时
sgpu-dkms_1.2.1_amd64.deb1.2.1MT 弹性 GPU 驱动程序
7cf757237_mtml_1.9.2-linux-R_amd64.deb1.9.2GPU 管理监控函数库
摩尔线程容器运行时套件安装说明文档_1.9.0.md1.9.0安装说明文档
mt-gpu-operator-1.4.0.tgz1.4.0MT GPU Operator 软件包
mt-gpu-operator-custom-resources-1.4.0.tgz1.4.0MT GPU Operator Custom Resources 包
mt-gpu-operator.yamlmt-gpu-operator yaml 文件
mthreads_v1alpha4_clusterconfig.yamlclusterconfig yaml 文件
mthreads_v1beta1_clusterpolicy.yamlclusterpolicy yaml 文件
install.shMTGPU Operator 部署脚本