具身智能新手名词表English

ConRFT

ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy进阶

先离线、再真机在线,用一致性策略给 VLA 做强化学习微调的方法。

ConRFT 由中科院自动化所赵冬斌团队 2025 年 2 月提出,发表于 RSS 2025。VLA 只在少量演示上做监督微调,在接触丰富的真机任务里成功率常常不够,而直接在真机上跑强化学习又慢又不安全。ConRFT 分两段:离线阶段(Cal-ConRFT)把行为克隆和 Q 学习结合,从少量演示里先学出较稳的策略和价值估计;在线阶段(HIL-ConRFT)在真机上继续用强化学习微调,允许人随时接管纠正,保证探索安全。动作头用一致性策略(一步或几步就能生成动作的扩散类模型),便于和强化学习结合。以 Octo-small 为底座,8 个真实任务经 45–90 分钟在线微调后平均成功率 96.3%,比纯监督微调高 144%。

例子任务包括拿香蕉、开抽屉、把面包放进烤面包机、插车轮、挂中国结等,在线训练时操作员可在机器人快出错时接管。

也叫
Cal-ConRFT、HIL-ConRFT
相关
强化学习微调、Consistency Policy(一致性策略)、HIL-SERL、人在回路、Octo、真机强化学习
来源
ConRFT (arXiv 2502.05450)
ConRFT 项目主页
信息截至
2025-04

在完整名词表里查看 →