现场算力运维 Agent
把 GPU、IB、RDMA、NCCL、告警与拓扑排查整理成一步一条命令的现场工作流。
- 本人职责
- 工作流、安全边界与验证合同设计
- 最后核验
- 2026/07/17
结果、职责和证据分开呈现;没有公开链接的证据不会生成空按钮。
把 GPU、IB、RDMA、NCCL、告警与拓扑排查整理成一步一条命令的现场工作流。
把新人入口、速查、故障处理、学习计划和资料索引生成适合手机阅读的静态知识站。
10 份当前内容源构建输入按当前 Markdown 文件重新计数。
构建口径待冻结现存 17 个 HTML 与当前输入推导的产物数量不一致,因此不对外宣称 17 页版本。
设备、链路、通信、观测、容器和调度各有独立入口,不把不同证据层混成一条答案。
从 XID、ECC、温度、功耗与降频信号建立设备健康证据顺序。
区分 InfiniBand 与 RoCE,再检查链路状态、错误计数、带宽和时延。
从拓扑、链路基线到软件栈,定位 all-reduce 卡顿、超时和 hang。
连接指标采集、看板和告警规则,同时保留阈值复核与演练边界。
拆开宿主机驱动、Container Toolkit、CUDA 与 GPU 设备暴露问题。
观察资源声明、排队、抢占和资源释放,不直接套用生产策略参数。
每阶段突出一个当前动作,其余方向保持可到达;完整验收标准留在详情页。
先建立设备与链路的证据顺序。
整理 nvidia-smi、内核日志和 DCGM 之间的证据顺序。
把基线、异常与告警连成闭环。
定义性能偏低、通信超时和完全卡死的证据矩阵。
补齐容器与调度的验证路径。
准备驱动、Toolkit、CUDA 镜像和设备映射的责任边界表。
文章和验证按真实日期排序,没有日期的路线动作明确标记为进行中。
PCIe 枚举、NVML 可见和调度可用不是同一层证据。先分层,再决定下一步。
公开资源、Schema、安全合同和黄金样例通过项目验证器。
执行中状态优先于下一条指令。单步工作流不是保守,而是为了保存证据和停止边界。
整理 nvidia-smi、内核日志和 DCGM 之间的证据顺序。
不公开客户、IP、设备编号、真实拓扑、原始日志、认证信息和私人运行状态。项目详情继续说明各自的脱敏范围。