Projects / public work

做成的东西,和下一步要做的事。

已有产物只写能够核验的事实;旧模板里的六个方向回到建设路线,并明确最近动作和通过条件。

已形成产物
08
建设方向
06
重点案例
03
含公开证据
05
01

先看证据,再看描述。

三个重点项目有可打开的脱敏验证资产;其余项目保留真实状态和来源核验结果。

02

旧模板的项目,回到路线图里。

这些方向尚未冒充成品。每项都写明最近动作、里程碑和验收标准,完成后再升格为上方案例。

01

诊断地基

先建立设备与链路的证据顺序。

资料整理阶段 01

GPU 健康诊断

围绕 XID、ECC、温度、功耗和降频建立可复核的 GPU 健康检查与排障路径。

最近动作
整理 nvidia-smi、内核日志和 DCGM 之间的证据顺序。
通过条件
每一步都写明输入、通过条件、停止条件和下一层证据。
查看建设计划
资料整理阶段 01

IB / RoCE 链路排查

围绕 IB、RDMA 与 RoCE 的状态、带宽、时延和丢包,整理链路诊断与基线验证方法。

最近动作
拆分物理链路、端口状态、错误计数和端到端测试四层证据。
通过条件
IB 和 RoCE 步骤不会混用诊断结论。
查看建设计划
02

通信与观测

把基线、异常与告警连成闭环。

资料整理阶段 02

NCCL 多机通信排障

针对多机 all-reduce 卡顿、超时和 hang,建立从拓扑到链路再到软件栈的诊断流程。

最近动作
定义性能偏低、通信超时和完全卡死的证据矩阵。
通过条件
单机与跨机证据层分开记录。
查看建设计划
资料整理阶段 02

DCGM GPU 监控与告警

把 DCGM 指标接入 Prometheus 与 Grafana,并为关键 GPU 健康信号建立告警规则。

最近动作
整理温度、功耗、利用率、显存、ECC 和设备状态的指标字典。
通过条件
示例阈值明确标注需要按设备规范和现场基线复核。
查看建设计划
03

运行环境

补齐容器与调度的验证路径。

未开始阶段 03

GPU 容器化部署规范

整理驱动、CUDA、容器运行时与 GPU 设备暴露之间的兼容关系和部署验证流程。

最近动作
准备驱动、Toolkit、CUDA 镜像和设备映射的责任边界表。
通过条件
能够区分宿主驱动、容器运行时和编排层问题。
查看建设计划
未开始阶段 03

Slurm GPU 作业调度

整理 GPU 资源声明、作业排队、抢占与故障恢复的 Slurm 调度操作和验证方法。

最近动作
准备节点、分区、GRES 和作业请求之间的资源映射示例。
通过条件
所有示例使用虚构用户、队列和节点。
查看建设计划