具身智能新手名词表English

Slurm 集群调度

Slurm Workload Manager进阶

GPU 集群上排队、分配显卡和提交训练任务的调度系统

Slurm 是开源的 Linux 集群作业调度系统,最早出自美国劳伦斯利弗莫尔国家实验室,后由 SchedMD 公司主要维护,大量超算中心和高校、企业的 GPU 集群都用它。多人共用一批机器时,大家不直接登录某台机器跑程序,而是把任务提交给 Slurm,由它按资源和优先级排队、分配节点和显卡。常用命令有 sbatch(提交脚本)、srun(直接运行)、squeue(查看队列)、scancel(取消任务)。训练 VLA 这类大模型、做多机多卡分布式训练时基本绕不开它。

例子写一个 train.sh,在开头声明需要 2 个节点、每节点 8 张 GPU,然后 sbatch train.sh 提交,用 squeue 看是否排上。

也叫
Slurm、SLURM
相关
分布式训练(数据并行 / 模型并行)、分布式数据并行、Ray 分布式框架、Docker、SSH 远程登录
来源
Slurm Workload Manager - Documentation

在完整名词表里查看 →