具身智能新手名词表English

残差强化学习

Residual Reinforcement LearningResidual RL进阶

保留一个现成的基础控制器,只用强化学习学它输出上的修正量。

残差强化学习在 2018 年底由两组工作几乎同时提出:UC 伯克利 Levine 组与西门子合作的 Residual Reinforcement Learning for Robot Control,以及 MIT 的 Residual Policy Learning。做法是最终动作等于基础策略的动作加上残差策略输出的修正量;基础策略可以是手写控制器、模型预测控制,或模仿学习得到的策略,强化学习只负责补上摩擦、接触这类难建模的部分。因为从一个「已经大致能用」的起点出发,探索更安全、样本效率更高,适合直接在真机上训练。近年它常被用来精修行为克隆策略:先用演示训练一个扩散或动作分块策略并冻结,再在上面训练一个小的闭环残差策略做实时修正。

例子MIT 的 ResiP 冻结一个用演示训练的动作分块策略,把它当作轨迹规划器,再用强化学习训练闭环残差策略实时修正,用于行为克隆加数据也难再提高成功率的精密装配任务。

也叫
残差策略学习、Residual Policy Learning、RPL
相关
残差策略、行为克隆、真机强化学习、强化学习微调、动作分块、噪声空间策略引导
来源
Johannink et al. 2018: Residual Reinforcement Learning for Robot Control
Silver et al. 2018: Residual Policy Learning
Ankile et al. 2024: From Imitation to Refinement -- Residual RL for Precise Assembly

在完整名词表里查看 →