ConRFT
ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy进阶先离线、再真机在线,用一致性策略给 VLA 做强化学习微调的方法。
ConRFT 由中科院自动化所赵冬斌团队 2025 年 2 月提出,发表于 RSS 2025。VLA 只在少量演示上做监督微调,在接触丰富的真机任务里成功率常常不够,而直接在真机上跑强化学习又慢又不安全。ConRFT 分两段:离线阶段(Cal-ConRFT)把行为克隆和 Q 学习结合,从少量演示里先学出较稳的策略和价值估计;在线阶段(HIL-ConRFT)在真机上继续用强化学习微调,允许人随时接管纠正,保证探索安全。动作头用一致性策略(一步或几步就能生成动作的扩散类模型),便于和强化学习结合。以 Octo-small 为底座,8 个真实任务经 45–90 分钟在线微调后平均成功率 96.3%,比纯监督微调高 144%。
例子任务包括拿香蕉、开抽屉、把面包放进烤面包机、插车轮、挂中国结等,在线训练时操作员可在机器人快出错时接管。
- 也叫
- Cal-ConRFT、HIL-ConRFT
- 相关
- 强化学习微调、Consistency Policy(一致性策略)、HIL-SERL、人在回路、Octo、真机强化学习
- 来源
- ConRFT (arXiv 2502.05450)
ConRFT 项目主页 - 信息截至
- 2025-04