数据中心 GPU 管理(MTDCGM)
概述
摩尔线程数据中心 GPU 管理器(Moore Threads Data Center GPU Manager,MTDCGM)面向集群和数据中心环境,提供 GPU 信息查询、状态监控、分组管理、健康检查和故障诊断功能。
MTDCGM 主要提供以下功能:
- 发现 GPU 并查询设备信息;
- 创建和管理 GPU 组与监控字段组;
- 持续采集和监控 GPU 运行数据;
- 检查 GPU、节点及运行环境的健康状态;
- 执行系统验证和分级 GPU 诊断;
- 通过 API 集成集群管理和监控系统。
您可以通过 dcgmi 命令行工具使用 MTDCGM,也可以通过 API 将其集成到其他管理系统。MTDCGM 支持独立模式和嵌入式模式:在独立模式下通过 Host Engine 运行,在嵌入式模式下作为共享库加载到应用程序中。
MTDCGM 支持 x86_64 Linux 平台。安装后,可使用 libdcgm.so.3 共享库、mt-hostengine 后台服务、dcgmi 命令行工具、DCGM Diagnostic(MTVS 验证套件)以及 C API 示例。
目标用户
MTDCGM 主要面向以下用户:
- 数据中心和基础设施管理员:部署 MTDCGM,监控 GPU 状态,管理 设备资源并执行节点健康检查;
- 集群管理与平台开发者:通过 API 将 GPU 管理和监控能力集成到现有系统;
- 技术支持和故障排查人员:结合诊断结果、Host Engine 日志和 XID 信息定位 GPU、驱动或系统问题。
管理员和故障排查人员通常使用 dcgmi 完成交互式操作;平台开发者可通过 API 或嵌入模式集成 MTDCGM 能力。
应用场景
MTDCGM 适用于以下场景:
-
监控 GPU 状态和运行数据
MTDCGM 可以发现主机上的 GPU,并持续采集设备状态和监控字段。管理员可以使用
dcgmi discovery查询设备,使用dcgmi dmon观察 GPU 或 GPU 组的运行数据。 -
检查 GPU 健康状态
MTDCGM 可监控 GPU 及相关系统组件的健康状态。管理员可以选择监控项、查看当前状态,并在完成维护或故障处理后重新验证节点。
-
执行系统验证和故障诊断
MTDCGM 的分级系统验证和诊断测试适用于节点上线前验证、故障定位和支持交接。诊断级别越高,检查范围和资源占用越大;执行高级别诊断前,请排空并隔离节点。
-
按组管理 GPU 资源
在单机多卡环境中,管理员可以将 GPU 组织为逻辑组,并对组内设备统一执行查询、监控和诊断操作。字段组可用于集中管理需要采集的监控指标。
-
集成集群管理和监控系统
开发者可以通过 MTDCGM API 连接独立 Host Engine,也可以将 MTDCGM 共享库嵌入应用程序,以集成集群管理和监控平台。
-
识别和处理 GPU 错误
MTDCGM 相关工具和文档提供 XID 错误的严重性、影响范围、原因和处置建议,便于运维人员判断故障影响并采取诊断、隔离或恢复措施。
名词解释
| 名词 | 含义 |
|---|---|
| MTDCGM | Moore Threads 的数据中心 GPU 管理器 |
| MTDCGM 共享库 | 核心动态库 libdcgm.so.3,提供 MTDCGM 管理能力和 C API |
| MT Host Engine | 独立可执行程序 mt-hostengine,加载 libdcgm.so.3,并以独立进程形式提供监控和管理服务 |
| Host Engine Daemon | mt-hostengine 以守护进程方式运行时的服务进程 |
| 第三方 MTDCGM 代理(3rd-party DCGM Agent) | 任何以嵌入式模式(Embedded Mode)加载并使用 MTDCGM 共享库的节点级第三方进程 |
| 嵌入式模式(Embedded Mode) | MTDCGM 共享库由第三方代理加载并在该代理进程中运行 |
| 独立模式(Standalone Mode) | MTDCGM 通过 mt-hostengine 作为独立进程运行 |
| 系统验证(System Validation) | 覆盖 GPU、板卡及周边环境的健康检查 |
| 硬件诊断(HW diagnostic) | 专注于 GPU 硬件正确性的系统验证组件 |
| MTML | 摩尔线程 GPU 管理库 (Moore Threads Management Library, MTML) |

