ReinFlow
ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning进阶给流匹配策略注入可学习噪声,再用在线强化学习微调的方法
卡内基梅隆大学、清华大学等的 Tonghe Zhang、Chao Yu、Yu Wang 等人 2025 年 5 月发布,发表于 NeurIPS 2025。流匹配策略(用速度场把噪声逐步变成动作的生成式策略)想再用强化学习提升时有个障碍:生成过程是确定性的,算不出动作概率,也缺少探索。ReinFlow 在每个去噪步加一个可学习的高斯噪声,把生成过程变成离散时间马尔可夫过程,就能精确算似然、用策略梯度微调;噪声网络只在训练时用,推理时丢掉。在腿足运动任务上,整流流策略的回合奖励平均提升约 135%,计算开销比扩散策略微调方法 DPPO 少约 83%。它与 DPPO、πRL 同属用强化学习微调生成式策略的方向。
例子先用演示训练一个只需很少去噪步数的 Shortcut 流策略,再用 ReinFlow 在 robomimic 仿真操作任务上在线强化学习,成功率明显提升。
- 相关
- 流匹配、DPPO(扩散策略策略优化)、πRL、强化学习微调、整流流、策略梯度
- 来源
- ReinFlow (arXiv 2505.22094)
ReinFlow project page - 信息截至
- 2025-05