DCGM GPU 监控与告警
把 DCGM 指标接入 Prometheus 与 Grafana,并为关键 GPU 健康信号建立告警规则。
最近动作整理温度、功耗、利用率、显存、ECC 和设备状态的指标字典。
Goal
公开目标
形成使用合成指标即可验证的 GPU 监控和告警最小闭环。
Why
为什么要做
只有指标面板还不能支持值班处理。采集范围、持续异常、恢复信号和告警抑制必须一起验证,告警才具备行动意义。
Milestones
建设里程碑
- 01采集范围
定义指标、标签、采样频率和数据缺失语义。
- 02展示层
用合成数据制作不含真实集群标签的看板。
- 03告警演练
验证持续异常、恢复和告警抑制路径。
Acceptance
验收标准
- 示例阈值明确标注需要按设备规范和现场基线复核。
- 至少一条合成异常能够触发并恢复告警。
- 公开看板不包含真实集群、节点和接收人。