Slurm GPU 作业调度
整理 GPU 资源声明、作业排队、抢占与故障恢复的 Slurm 调度操作和验证方法。
最近动作准备节点、分区、GRES 和作业请求之间的资源映射示例。
Goal
公开目标
形成使用合成作业说明 GPU 资源申请、排队和状态变化的值班手册。
Why
为什么要做
作业排队、抢占和资源未释放都需要结合 GRES、分区和作业声明解释。没有状态路径时,值班人员只能看到结果,无法判断下一步。
Milestones
建设里程碑
- 01资源模型
解释节点、分区、GRES 和作业声明的映射关系。
- 02状态路径
观察排队、资源不足、抢占、失败重试和节点下线。
- 03值班手册
把查询、判断、升级和恢复验证整理成单步流程。
Acceptance
验收标准
- 所有示例使用虚构用户、队列和节点。
- 每种状态都能解释原因、下一步和恢复信号。
- 策略内容只作为实验材料,不直接给出生产参数建议。