具身智能新手名词表English

残差策略

Residual Policy进阶

在已有控制器或策略的输出上再学一个修正量,两者相加作为最终动作。

残差策略指不从零学整个策略,而是保留一个现成的基础策略(手工控制器、模型预测控制,或模仿学习训好的策略),另训练一个网络只输出对它的修正量,最终动作等于基础动作加残差。2018 年 MIT 的 Silver 等人提出残差策略学习,几乎同时 Johannink、Levine 等人在真实机器人的积木装配上验证了残差强化学习。好处是基础策略已经能把任务做个大概,残差只需补上难以建模的部分,比如摩擦、接触和标定误差,探索空间小、样本效率高,也更安全。近年常见的用法是冻结一个扩散策略或 VLA,再用强化学习训练一个轻量的逐步闭环残差,提升精细装配等任务的成功率。

例子ResiP(Pulkit Agrawal 组,2024)冻结一个带动作分块的扩散策略,用 PPO 训练逐步闭环的残差策略做修正,在 FurnitureBench 家具装配等仿真任务上大幅提高成功率,再通过教师-学生蒸馏迁移到真机。

也叫
残差策略学习、Residual Policy Learning、RPL
相关
残差强化学习、扩散策略、强化学习微调、动作分块、模型预测控制、教师-学生蒸馏
来源
Residual Policy Learning (Silver et al., arXiv 1812.06298)
Residual Reinforcement Learning for Robot Control (Johannink et al., arXiv 1812.03201)
From Imitation to Refinement -- Residual RL for Precise Assembly (ResiP, arXiv 2407.16677)
信息截至
2024-07

在完整名词表里查看 →