交互式模仿学习
Interactive Imitation LearningIIL进阶机器人边执行、人边纠正,用这些反馈在线改进策略的模仿学习。
交互式模仿学习是模仿学习的一个分支:人类在机器人执行过程中间歇性地给反馈,比如接管纠正、标注正确动作或评价好坏,策略据此在线改进。它主要针对行为克隆的复合误差问题——离线示范只覆盖专家走过的状态,机器人一旦偏离就没有数据可学,越错越远。代表算法是 Ross 等人 2011 年提出的 DAgger:让专家给学生策略实际遇到的状态标注动作,汇总进数据集再训练;HG-DAgger 等变体改为由人决定何时接管。Celemin 等人 2022 年的综述系统整理了这一方向。
例子典型流程:先用示范数据训练初版插孔策略,让机械臂自己执行,偏离时由操作员接管并记录纠正动作,把这些纠正数据并入训练集再训练,如此循环几轮。
- 也叫
- 交互模仿学习
- 相关
- DAgger(数据集聚合)、人工门控 DAgger、复合误差、行为克隆、人在回路、干预数据
- 来源
- Interactive Imitation Learning in Robotics: A Survey (arXiv:2211.00600)
A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger, arXiv:1011.0686)