πRL
πRL: Online RL Fine-tuning for Flow-based Vision-Language-Action Models进阶给 π0、π0.5 这类流匹配 VLA 做在线强化学习微调的开源框架
清华大学、北京大学、中科院自动化所等团队 2025 年 10 月发布,构建在开源强化学习框架 RLinf 上。难点在于流匹配 VLA 通过多步去噪生成动作,算不出动作的对数概率,没法直接套用 PPO 这类策略梯度算法。πRL 给了两种解法:Flow-Noise 把去噪过程建模成离散时间 MDP,用一个可学习的噪声网络让对数似然可以精确计算;Flow-SDE 把确定性的 ODE 采样改成带随机性的 SDE 采样,把去噪和环境交互组成两层 MDP,便于探索。在 LIBERO 和 ManiSkill 上都大幅提升了少样本监督微调后的策略,也在 GR00T N1.5 上做了验证。
例子只用少量演示监督微调的 π0 在 LIBERO 上成功率 57.6%,经 πRL 强化学习后达到 97.6%;π0.5 从 77.1% 提到 98.3%。
- 也叫
- piRL、pi_RL、π_RL
- 相关
- π0、π0.5、RLinf、强化学习微调、流匹配、近端策略优化
- 来源
- πRL (arXiv:2510.25889)
πRL 论文 HTML 版 - 信息截至
- 2026-01