Consistency Policy(一致性策略)
Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation进阶把扩散策略蒸馏成一步就能出动作的快速视觉运动策略。
斯坦福 Jeannette Bohg 组(一作 Aaditya Prasad)与普林斯顿的 Jimmy Wu 等人 2024 年 5 月提出,发表于 RSS 2024。扩散策略(Diffusion Policy)动作质量好,但每次出动作要去噪几十上百步,在笔记本 GPU 或机载电脑上太慢。Consistency Policy 以训练好的扩散策略为「老师」,用一致性轨迹模型(CTM)的目标做蒸馏:要求学生网络从去噪轨迹上任意一点出发都能跳到同一个终点(即「自一致性」),推理时一步就能生成整段动作。论文在 Robomimic、Push-T、Franka Kitchen 共 6 个仿真任务和 3 个真机任务上测试,推理比同类方法快一个数量级,成功率基本持平。它是扩散策略提速路线的代表,ConRFT 等后续工作也用它当策略骨架。
例子真机实验里,机器人只用笔记本级 GPU 运行 Consistency Policy 完成插插头、收拾垃圾等任务,用单步生成代替扩散策略的多步去噪。
- 也叫
- 一致性策略、Consistency Policy
- 相关
- 扩散策略、一致性模型、单步生成、知识蒸馏、推理延迟、ConRFT
- 来源
- Consistency Policy (arXiv:2405.07503)
Consistency Policy 项目主页(RSS 2024) - 信息截至
- 2024-06