智算现场运维资料整理阶段 02

DCGM GPU 监控与告警

把 DCGM 指标接入 Prometheus 与 Grafana,并为关键 GPU 健康信号建立告警规则。

最近动作整理温度、功耗、利用率、显存、ECC 和设备状态的指标字典。

Goal

公开目标

形成使用合成指标即可验证的 GPU 监控和告警最小闭环。

Why

为什么要做

只有指标面板还不能支持值班处理。采集范围、持续异常、恢复信号和告警抑制必须一起验证,告警才具备行动意义。

Milestones

建设里程碑

  1. 01
    采集范围

    定义指标、标签、采样频率和数据缺失语义。

  2. 02
    展示层

    用合成数据制作不含真实集群标签的看板。

  3. 03
    告警演练

    验证持续异常、恢复和告警抑制路径。

Acceptance

验收标准

  • 示例阈值明确标注需要按设备规范和现场基线复核。
  • 至少一条合成异常能够触发并恢复告警。
  • 公开看板不包含真实集群、节点和接收人。
返回项目与建设路线