veRL
veRL (Volcano Engine Reinforcement Learning library)进阶字节跳动开源的大模型强化学习训练框架,也被用于 VLA 的 RL。
veRL 是字节跳动 Seed 团队(以火山引擎名义)开源的强化学习训练库,是论文 HybridFlow(EuroSys 2025)的开源实现。大模型做 RL 要反复执行两件事:用当前模型批量生成样本(rollout),再用这些样本更新参数,两边需要的并行方式不同。veRL 把生成交给 vLLM、SGLang 等推理引擎,训练交给 FSDP 或 Megatron,并负责两者之间的权重同步和调度,内置 PPO、GRPO 等算法。它原本面向语言模型,后来被具身领域借用来给 VLA 做在线强化学习微调。
例子SimpleVLA-RL 基于 veRL 搭建,在 LIBERO 等仿真环境里并行 rollout,用任务成功与否作为奖励对 OpenVLA-OFT 做 GRPO 类强化学习。
- 也叫
- verl、HybridFlow
- 相关
- 强化学习微调、组相对策略优化、近端策略优化、vLLM、SimpleVLA-RL、Ray 分布式框架
- 来源
- volcengine/verl GitHub
HybridFlow: A Flexible and Efficient RLHF Framework (arXiv)