现场算力运维 Agent
把 GPU、IB、RDMA、NCCL、告警与拓扑排查整理成一步一条命令的现场工作流。
- 本人职责
- 工作流、安全边界与验证合同设计
- 时间范围
- 持续迭代
- 技术栈
- Python / Shell / Markdown / JSON Schema
- 最后核验
- 2026/07/17
01 / Problem
问题背景
现场排障需要保存证据顺序和停止边界,但通用 Agent 往往一次给出过多命令,容易把说明、计划和真实执行混在一起。
02 / Approach
方法与结构
- 把命令查询、准备执行、执行中、已有结果和记录模式拆成不同状态。
- 按 GPU、网络、BMC、拓扑和告警场景组织脚本、参考资料与安全报告合同。
- 使用公开安全夹具、Schema 和黄金样例验证输出结构。
03 / Decisions
核心决策与取舍
- 执行中不发送下一条命令,优先等待提示符和完整输出。
- 状态变更操作必须同时给出目标、影响、停止条件和恢复检查。
- 公开证据只使用合成输入和脱敏摘要,不复制现场日志。
04 / Outcome
结果与当前边界
- 形成 10 个自动化脚本和 20 份场景参考。
- 验证器在 2026-07-18 重新执行并返回成功。
- 现场诊断默认只读,状态变更必须经过单独确认。
05 / Evidence
可查看证据
只有重新执行或重新检查过的事实才进入这里;没有公开链接的项目只显示来源核验摘要。
验证器通过
公开资源、Schema、安全合同和黄金样例通过项目验证器。
打开证据10 个脚本 / 20 份参考
按脚本目录和参考资料目录重新计数。
单步执行设计说明
解释为什么现场工作流必须一次只推进一条命令。
打开证据