智算现场运维可运行
现场算力运维 Agent
把 GPU、IB、RDMA、NCCL、告警与拓扑排查整理成一步一条命令的现场工作流。
- 当前证据
- 验证器通过
- 最后核验
- 2026/07/17
项目与建设路线
Projects / public work
已有产物只写能够核验的事实;旧模板里的六个方向回到建设路线,并明确最近动作和通过条件。
三个重点项目有可打开的脱敏验证资产;其余项目保留真实状态和来源核验结果。
把 GPU、IB、RDMA、NCCL、告警与拓扑排查整理成一步一条命令的现场工作流。
七个本地工具共享命令行和网页入口,覆盖热点、配置、Skills、告警、OCR、网页健康和安全自查。
只读抓取市场数据,过滤脏市场,记录首次观察概率,并在结算后做闭环验证。
这些方向尚未冒充成品。每项都写明最近动作、里程碑和验收标准,完成后再升格为上方案例。
先建立设备与链路的证据顺序。
围绕 XID、ECC、温度、功耗和降频建立可复核的 GPU 健康检查与排障路径。
围绕 IB、RDMA 与 RoCE 的状态、带宽、时延和丢包,整理链路诊断与基线验证方法。
把基线、异常与告警连成闭环。
针对多机 all-reduce 卡顿、超时和 hang,建立从拓扑到链路再到软件栈的诊断流程。
把 DCGM 指标接入 Prometheus 与 Grafana,并为关键 GPU 健康信号建立告警规则。
补齐容器与调度的验证路径。
整理驱动、CUDA、容器运行时与 GPU 设备暴露之间的兼容关系和部署验证流程。
整理 GPU 资源声明、作业排队、抢占与故障恢复的 Slurm 调度操作和验证方法。