基于可验证奖励的强化学习
Reinforcement Learning with Verifiable RewardsRLVR进阶用程序能自动判对错的结果当奖励,对模型做强化学习训练。
RLVR 这个名字出自艾伦人工智能研究所(Ai2)2024 年 11 月的 Tülu 3 论文:对数学题、可自动检查的指令约束等任务,用规则或程序判断模型输出是否正确,答对给一个固定奖励、答错给 0,再用 PPO 等强化学习算法更新模型。它不需要单独训练奖励模型(RLHF 里给回答打分的网络),奖励来源更可靠,相对不易被模型钻空子。2025 年 DeepSeek-R1 用基于规则的准确性奖励练出推理能力,让这条路线广为人知。放到机器人上,「任务成没成功」就是天然的可验证奖励,SimpleVLA-RL、VLA-RFT 等工作都用成功与否的二值奖励对 VLA 做强化学习微调。
例子SimpleVLA-RL 在 OpenVLA-OFT 上只用「任务成功得奖励、失败不得」的结果奖励做强化学习,在 LIBERO 上取得领先成绩,在 RoboTwin 1.0 / 2.0 上超过 π0,真机表现也好于只做监督微调的版本。
- 也叫
- 可验证奖励强化学习、RL with Verifiable Rewards
- 相关
- 强化学习微调、奖励模型、基于人类反馈的强化学习、组相对策略优化、稀疏奖励、SimpleVLA-RL
- 来源
- Lambert et al. 2024: Tülu 3: Pushing Frontiers in Open Language Model Post-Training
DeepSeek-AI 2025: DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Li et al. 2025: SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning - 信息截至
- 2025-09