DeepSpeed
进阶微软开源的大模型分布式训练加速库,以 ZeRO 显存优化出名
DeepSpeed 是微软开源的深度学习训练与推理优化库,建立在 PyTorch 之上。它最有名的是 ZeRO(零冗余优化器):把优化器状态、梯度甚至模型参数切分到多张 GPU 上,而不是每张卡都存一份完整副本,从而用有限显存训练更大的模型。此外还提供混合精度、梯度累积、CPU/NVMe 卸载、流水线并行等功能。训练参数量达数十亿的 VLA 或大语言模型时,单卡放不下,常用 DeepSpeed 或 PyTorch 自带的 FSDP 解决,两者思路相近。Hugging Face Accelerate 等框架也可以直接调用它。
例子微调一个 7B 参数的 VLA 时,在训练脚本里打开 DeepSpeed ZeRO-2 或 ZeRO-3 配置,让 8 张卡分摊优化器状态和梯度。
- 相关
- 全分片数据并行、分布式数据并行、混合精度训练、分布式训练(数据并行 / 模型并行)、Accelerate 库、PyTorch
- 来源
- DeepSpeed 官网
DeepSpeed GitHub