Slurm 集群调度
Slurm Workload Manager进阶GPU 集群上排队、分配显卡和提交训练任务的调度系统
Slurm 是开源的 Linux 集群作业调度系统,最早出自美国劳伦斯利弗莫尔国家实验室,后由 SchedMD 公司主要维护,大量超算中心和高校、企业的 GPU 集群都用它。多人共用一批机器时,大家不直接登录某台机器跑程序,而是把任务提交给 Slurm,由它按资源和优先级排队、分配节点和显卡。常用命令有 sbatch(提交脚本)、srun(直接运行)、squeue(查看队列)、scancel(取消任务)。训练 VLA 这类大模型、做多机多卡分布式训练时基本绕不开它。
例子写一个 train.sh,在开头声明需要 2 个节点、每节点 8 张 GPU,然后 sbatch train.sh 提交,用 squeue 看是否排上。
- 也叫
- Slurm、SLURM
- 相关
- 分布式训练(数据并行 / 模型并行)、分布式数据并行、Ray 分布式框架、Docker、SSH 远程登录
- 来源
- Slurm Workload Manager - Documentation