跳到主要内容

MTDCGM XID 参考手册

概述

XID 用于识别和记录 GPU 在运行过程中发生的各类错误,并提供后续处置所需的信息。



目标用户

本文面向系统运维人员、FAE 和开发人员,帮助您根据 XID 判断问题范围、初步定位原因并采取现场措施。



使用场景

发生 XID 后,系统运维人员、FAE 和第三方开发者可以据此确认问题范围、初步判断原因并采取现场措施。记录的 XID 也可作为问题上报以及返修、退货评估的部分依据,供 MT 内部进一步分析。



解读 XID

解读 XID 时,请重点查看严重性、影响范围、可能原因和处置措施。结合这些字段,可以判断错误对业务的影响,并确定下一步操作。

严重性

严重性表示错误的影响程度,分为以下三个级别:

  • 致命级(FATAL):GPU 遇到严重且无法恢复的错误,无法正常运行,例如设备初始化失败或硬件自检出错。此级别主要影响系统可用性。

  • 告警级(WARN):错误会影响系统或业务,且没有外界干预时无法自动恢复,例如 GPU lockup。此级别主要影响系统稳定性。

  • 感知级(NOTI):错误不会破坏业务,或可以自动纠正、容忍,例如 MTLink CRC 错误和 PCIe retransmit。此级别主要影响系统性能和效率。

影响范围

影响范围表示 XID 错误影响的对象,分为以下级别:

  • 进程级(PROC):错误仅影响对应的应用程序或进程。
  • GPU 设备级(GPU):错误会影响使用对应 GPU 设备的所有应用程序或进程。
  • 主机级(HOST):错误会影响当前主机上的多个或所有 GPU。
  • 系统级(SYS):错误会影响不止一台主机。

错误原因

错误原因属性描述可能引发该XID错误的原因,用于指导用户处理错误。错误原因可分为以下类别:

  • 硬件错误(HW):GPU 硬件发生错误导致产生对应 XID 错误。
  • 驱动错误(DRV):驱动程序出错诱发对应 XID 错误。
  • 用户程序错误(UAPP):用户程序错误引发对应的 XID 错误。
  • 系统内存损坏(SMEM):系统内存损坏导致对应的 XID 错误。
  • PCIe 总线故障(PCIe):PCIe 总线故障导致对应的 XID 错误。
  • MTLink 总线故障(LINK):MTLink 总线故障导致对应的 XID 错误。
  • 热管理错误(THM):热管理错误导致对应的 XID 错误。

一个 XID 可能对应多个原因,无法仅凭该字段精确定位故障。因此,表中的原因是可能触发该 XID 的原因集合。

处置措施

处置措施提供现场处理 XID 错误的指导。对于致命级和告警级错误,请优先按照表中建议操作,确保措施在现场可执行。

每条 XID 都有自身的处置措施;此外,还可以根据可能原因选择对应的推荐措施。各类错误原因的推荐措施如下。

错误原因推荐处置措施
驱动错误记录并上报错误信息、重启设备/重新加载驱动/重启主机
硬件错误检查硬件物理连接、将故障设备/主机从系统中隔离、申请设备返修或退货处理
用户程序错误查看 GPU 故障排查、运行 memcheck、重启应用程序

XID 格式

XID 有一套标准格式如下:

[MTGPU] XID:(XID_ID)-(XID_NAME) (SEV:Severity) (SCP:Scope) PCI:(BDF) (TS:Timestamp) (UUID:unique id) [(GPU-I:gi_id)] [PID:(UserPID)](Additional information)

例如 MTLink 上报 uncorrectable error 的 XID:

[MTGPU] XID:1-mtlink_unrecoverable_error SEV:fatal SCP:host PCI:0000:01:00 TS:17766900 UUID:1001 PID:1032 -> lchip:1 llink:1 rchip:2 rlink:2


XID 参考表

“可能原因”列中的缩写含义参见 错误原因

KERNEL DRIVER(模块号 0x00)

错误号错误严重性影响范围可能原因处置措施附加信息关联性说明
HEX:0x00000001
DEC:1
GPU Initialization FailureFATALGPUHW、DRV重启 GPU 设备(mthreads-gmi -r 2)或主机;隔离设备或主机通常由驱动错误导致 GPU 内部固件无法正常启动
HEX:0x00000002
DEC:2
GPU FW RebootNOTIGPUHW、DRV<Retry Seq>如果重启失败,则后续跟随 GPU Initialization Failure 错误驱动正在尝试重启 GPU 固件程序。<Retry Seq>:重试序号,取值范围为 1 到 Retry Limit,每次新的 reboot 会话都从 1 开始

GPU(模块号 0x01)

错误号错误严重性影响范围可能原因处置措施附加信息关联性说明
HEX:0x01000001
DEC:16777217
GPU Overrun(GPU Semaphore Timeout)WARNGPUDRV、UAPP、SMEM、PCIe、LINK检查应用程序任务超时,可能是应用程序逻辑过长,或下发给 GPU 的命令无法在规定时间内完成,GPU 应用程序或内存管理相关逻辑可能存在问题
HEX:0x01000002
DEC:16777218
GPU Lockup(GPU Stopped Processing)WARNGPUDRV、UAPP、SMEM、PCIe、LINK检查应用程序下发给 GPU 的命令出错或包含非法指令。GPU 内部 watchdog 发现 MP idle,但 Engine 没有上报完成;GPU 应用程序和内存管理逻辑均可能存在问题
HEX:0x01000003
DEC:16777219
GPU Memory PagefaultWARNGPUHW、DRV、UAPP检查应用程序由于驱动错误或应用程序逻辑错误,访问的 GPU VA 地址没有正确映射
HEX:0x01000004
DEC:16777220
FW Communication FailureWARNGPUHW、DRV重启 GPU 设备(mthreads-gmi -r 2)或主机;隔离设备或主机;申请返修或退货<Reason>Reason:Loss interrupt,FW 到 KMD 的响应中断丢失
HEX:0x01000005
DEC:16777221
MUSA Processor ExceptionWARNGPUHW、DRV、UAPP检查应用程序MP 上的 SHADER 执行出错,GPU 尝试自动重置。当前 GPU 上正在运行的任务都将失败,重置完成后不影响后续任务的执行
HEX:0x01000006
DEC:16777222
GPU Hardware FailureFATALGPUHW重启 GPU 设备(mthreads-gmi -r 2)或主机;隔离设备或主机;申请返修或退货<Reason>GPU 发生硬件故障,导致设备无法正常运行。Reason:0 - Unknown;1 - D2D Link Error(仅 S5000)
HEX:0x01000007
DEC:16777223
GPU Run TimeoutWARNGPUHW、DRV、UAPP、SMEM、PCIe、LINK检查应用程序;重启 GPU 设备(mthreads-gmi -r 2)或主机;隔离设备或主机;申请返修或退货<Type>GPU Kernel 运行时间超过用户给定的超时时长。Type:CSW_TIMEOUT、RUN_TIMEOUT、KILL_TIMEOUT
HEX:0x01000008
DEC:16777224
GPU FW HangWARNGPUHW、DRV、UAPP检查应用程序;重启 GPU 设备(mthreads-gmi -r 2)或主机;隔离设备或主机;申请返修或退货<FaultId>FaultId 为十进制数字

MSS(模块号 0x02)

错误号错误严重性影响范围可能原因处置措施附加信息关联性说明
HEX:0x02000007
DEC:33554439
AXI ErrorFATALGPUHW重启 GPU 设备(mthreads-gmi -r 2)或主机;隔离设备或主机;申请返修或退货<Type>MTLink DownAXI 总线遭遇硬件错误。<Type>:SLAVE ERROR、TIMEOUT、DECODE ERROR
HEX:0x02000008
DEC:33554440
GPU Out Of Memory AllocationWARNPROCHW、DRV检查应用程序由于内存碎片化,即使剩余显存足够,仍然无法分配大块显存

MTBIOS(模块号 0x05)

错误号错误严重性影响范围可能原因处置措施附加信息关联性说明
HEX:0x05000001
DEC:83886081
GPU Fan AbnormalityWARNGPUHW检查 GPU 风扇和散热系统;重启 GPU 设备(mthreads-gmi -r 2)或主机;隔离设备或主机;申请返修或退货<GpuId>GPU 风扇转速异常或停止转动
HEX:0x05000002
DEC:83886082
GPU BIOS TrapFATALGPUHW重启 GPU 设备(mthreads-gmi -r 2)或主机;隔离设备或主机;申请返修或退货GPU BIOS 发生致命错误
HEX:0x05000003
DEC:83886083
GPU Temperature Too HighWARNGPUHW、THM检查散热器安装及服务器散热;重启 GPU 设备(mthreads-gmi -r 2)或主机;隔离设备或主机;申请返修或退货由于负载过高或散热不佳,GPU 核心温度超过预设安全值,将进入降温保护
HEX:0x05000004
DEC:83886084
GPU ShutdownFATALGPUHW、THM检查散热器安装及服务器散热;主机重新下电再上电;隔离设备或主机;申请返修或退货GPU 温度超过预设门限,导致 GPU 自动离线
HEX:0x05000005
DEC:83886085
GPU SlowdownWARNGPUHW、THM检查散热器安装及服务器散热<Slowdown Count>GPU 温度过高触发降频保护

PCIe(模块号 0x06)

错误号错误严重性影响范围可能原因处置措施附加信息关联性说明
HEX:0x06000001
DEC:100663297
GPU Has Fallen Off The BusWARNGPUHW、DRV、SMEM、PCIe重启主机;隔离设备或主机;申请返修或退货PCIe 链路异常引起硬件故障,导致掉卡

MTLink(模块号 0x07)

错误号错误严重性影响范围可能原因处置措施附加信息关联性说明
HEX:0x07000001
DEC:117440513
MTLink DownWARNGPUHW、LINK、THM重启主机;重新插拔 MTLink Down 的 GPU 卡;隔离设备或主机;申请返修或退货<Llink> <Rlink>MTLink Down 表示当前 Link 出现断连
HEX:0x07000002
DEC:117440514
MTLink UpNOTIGPU<Link>MTLink Up 表示当前 Link 已建立连接,用于表示 Link Down 的问题已恢复
HEX:0x07000003
DEC:117440515
MTLink Unrecoverable ErrorFATALGPUHW、LINK、THM检查硬件连接;重启 GPU 设备(mthreads-gmi -r 2)或主机;隔离设备或主机;申请返修或退货<Lchip> <Llink> <Rchip> <Rlink>MTLink Down与 MTLink Down 同步出现,表示 MTLink 永久性错误且无法恢复,需要重启相关 GPU 设备
HEX:0x07000004
DEC:117440516
MTLink DowngradeWARNGPUHW、LINK、THM检查硬件连接;更换 Link 连接线<Link> <Down Lane Count> <Total Lane Count>MTLink Up不会与 MTLink Up 同时出现;Link 中部分 Lane 不可用,Link 总带宽受限

DMA(模块号 0x0A)

错误号错误严重性影响范围可能原因处置措施附加信息关联性说明
HEX:0x0A000001
DEC:167772161
DMA ErrorWARNGPUHW、DRV、LINK重启 GPU 设备(mthreads-gmi -r 2)或主机;更换驱动;隔离设备或主机;申请返修或退货<ProcId> <DMA Error Type>传输超时:无中断返回;描述符错误:描述符配置错误;配置错误:DMA 寄存器配置错误


相关文档

  • 诊断指南:运行主动健康检查并分析诊断结果。
  • FAQ:了解 XID 与硬件故障的关系及常见处置问题。
  • GPU 故障排查:保留故障现场并继续排查 GPU、驱动、PCIe 或 MTLink 问题。