MTDCGM XID 参考手册
概述
XID 用于识别和记录 GPU 在运行过程中发生的各类错误,并提供后续处置所需的信息。
目标用户
本文面向系统运维人员、FAE 和开发人员,帮助您根据 XID 判断问题范围、初步定位原因并采取现场措施。
使用场景
发生 XID 后,系统运维人员、FAE 和第三方开发者可以据此确认问题范围、初步判断原因并采取现场措施。记录的 XID 也可作为问题上报以及返修、退货评估的部分依据,供 MT 内部进一步分析。
解读 XID
解读 XID 时,请重点查看严重性、影响范围、可能原因和处置措施。结合这些字段,可以判断错误对业务的影响,并确定下一步操作。
严重性
严重性表示错误的影响程度,分为以下三个级别:
-
致命级(FATAL):GPU 遇到严重且无法恢复的错误,无法正常运行,例如设备初始化失败或硬件自检出错。此级别主要影响系统可用性。
-
告警级(WARN):错误会影响系统或业务,且没有外界干预时无法自动恢复,例如 GPU lockup。此级别主要影响系统稳定性。
-
感知级(NOTI):错误不会破坏业务,或可以自动纠正、容忍,例如 MTLink CRC 错误和 PCIe retransmit。此级别主要影响系统性能和效率。
影响范围
影响范围表示 XID 错误影响的对象,分为以下级别:
- 进程级(PROC):错误仅影响对应的应用程序或进程。
- GPU 设备级(GPU):错误会影响使用对应 GPU 设备的所有应用程序或进程。
- 主机级(HOST):错误会影响当前主机上的多个或所有 GPU。
- 系统级(SYS):错误会影响不止一台主机。
错误原因
错误原因属性描述可能引发该XID错误的原因,用于指导用户处理错误。错误原因可分为以下类别:
- 硬件错误(HW):GPU 硬件发生错误导致产生对应 XID 错误。
- 驱动错误(DRV):驱动程序出错诱发对应 XID 错误。
- 用户程序错误(UAPP):用户程序错误引发对应的 XID 错误。
- 系统内存损坏(SMEM):系统内存损坏导致对应的 XID 错误。
- PCIe 总线故障(PCIe):PCIe 总线故障导致对应的 XID 错误。
- MTLink 总线故障(LINK):MTLink 总线故障导致对应的 XID 错误。
- 热管理错误(THM):热管理错误导致对应的 XID 错误。
一个 XID 可能对应多个原因,无法仅凭该字段精确定位故障。因此,表中的原因是可能触发该 XID 的原因集合。
处置措施
处置措施提供现场处理 XID 错误的指导。对于致命级和告警级错误,请优先按照表中建议操作,确保措施在现场可执行。
每条 XID 都有自身的处置措施;此外,还可以根据可能原因选择对应的推荐措施。各类错误原因的推荐措施如下。
| 错误原因 | 推荐处置措施 |
|---|---|
| 驱动错误 | 记录并上报错误信息、重启设备/重新加载驱动/重启主机 |
| 硬件错误 | 检查硬件物理连接、将故障设备/主机从系统中隔离、申请设备返修或退货处理 |
| 用户程序错误 | 查看 GPU 故障排查、运行 memcheck、重启应用程序 |
XID 格式
XID 有一套标准格式如下:
[MTGPU] XID:(XID_ID)-(XID_NAME) (SEV:Severity) (SCP:Scope) PCI:(BDF) (TS:Timestamp) (UUID:unique id) [(GPU-I:gi_id)] [PID:(UserPID)] → (Additional information)
例如 MTLink 上报 uncorrectable error 的 XID:
[MTGPU] XID:1-mtlink_unrecoverable_error SEV:fatal SCP:host PCI:0000:01:00 TS:17766900 UUID:1001 PID:1032 -> lchip:1 llink:1 rchip:2 rlink:2
XID 参考表
“可能原因”列中的缩写含义参见 错误原因。