具身智能新手名词表English

交互式模仿学习

Interactive Imitation LearningIIL进阶

机器人边执行、人边纠正,用这些反馈在线改进策略的模仿学习。

交互式模仿学习是模仿学习的一个分支:人类在机器人执行过程中间歇性地给反馈,比如接管纠正、标注正确动作或评价好坏,策略据此在线改进。它主要针对行为克隆的复合误差问题——离线示范只覆盖专家走过的状态,机器人一旦偏离就没有数据可学,越错越远。代表算法是 Ross 等人 2011 年提出的 DAgger:让专家给学生策略实际遇到的状态标注动作,汇总进数据集再训练;HG-DAgger 等变体改为由人决定何时接管。Celemin 等人 2022 年的综述系统整理了这一方向。

例子典型流程:先用示范数据训练初版插孔策略,让机械臂自己执行,偏离时由操作员接管并记录纠正动作,把这些纠正数据并入训练集再训练,如此循环几轮。

也叫
交互模仿学习
相关
DAgger(数据集聚合)、人工门控 DAgger、复合误差、行为克隆、人在回路、干预数据
来源
Interactive Imitation Learning in Robotics: A Survey (arXiv:2211.00600)
A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger, arXiv:1011.0686)

在完整名词表里查看 →