具身智能新手名词表English

分布式训练(数据并行 / 模型并行)

Distributed Training (Data / Model Parallelism)常用

把一次训练拆到多张 GPU 或多台机器上同时算,以训更大的模型和更多数据。

模型或数据大到一张 GPU 装不下、算不完时,就要把训练拆到多卡多机上。常见拆法有两类:数据并行是每张卡放一份完整模型、各算一部分数据,反向传播后把各卡梯度汇总求平均再同步更新,PyTorch 的 DDP(分布式数据并行)就是这种;模型并行是把模型本身切开放到不同卡上,比如英伟达 Megatron-LM 把 Transformer 每层的矩阵切到多卡(张量并行),也有按层分段的流水线并行。FSDP(全分片数据并行)仍按数据切分,但把参数、梯度和优化器状态也分片存到各卡,显存占用明显下降。数十亿参数的 VLA 预训练和全参数微调都离不开这些手段。

例子OpenVLA(7B 参数)预训练用了 64 张 A100、训练 14 天;论文里全参数微调也要 8 张 A100 跑 5–15 小时,其中显存测试是用 FSDP 把模型分到 2 张卡上完成的。

也叫
多卡训练、数据并行、模型并行、Data Parallelism、Model Parallelism、张量并行、流水线并行
相关
分布式数据并行、全分片数据并行、DeepSpeed、混合精度训练、梯度累积、批大小
来源
PyTorch Tutorial: Getting Started with Distributed Data Parallel
PyTorch Tutorial: Getting Started with Fully Sharded Data Parallel (FSDP)
Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism

在完整名词表里查看 →