具身智能新手名词表English

ReinFlow

ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning进阶

给流匹配策略注入可学习噪声,再用在线强化学习微调的方法

卡内基梅隆大学、清华大学等的 Tonghe Zhang、Chao Yu、Yu Wang 等人 2025 年 5 月发布,发表于 NeurIPS 2025。流匹配策略(用速度场把噪声逐步变成动作的生成式策略)想再用强化学习提升时有个障碍:生成过程是确定性的,算不出动作概率,也缺少探索。ReinFlow 在每个去噪步加一个可学习的高斯噪声,把生成过程变成离散时间马尔可夫过程,就能精确算似然、用策略梯度微调;噪声网络只在训练时用,推理时丢掉。在腿足运动任务上,整流流策略的回合奖励平均提升约 135%,计算开销比扩散策略微调方法 DPPO 少约 83%。它与 DPPO、πRL 同属用强化学习微调生成式策略的方向。

例子先用演示训练一个只需很少去噪步数的 Shortcut 流策略,再用 ReinFlow 在 robomimic 仿真操作任务上在线强化学习,成功率明显提升。

相关
流匹配、DPPO(扩散策略策略优化)、πRL、强化学习微调、整流流、策略梯度
来源
ReinFlow (arXiv 2505.22094)
ReinFlow project page
信息截至
2025-05

在完整名词表里查看 →