人工门控 DAgger
Human-Gated DAggerHG-DAgger进阶机器人快出错时由人接管纠正,只收集接管片段来迭代训练的 DAgger 变体。
斯坦福 Kelly 等人 2018 年提出。原版 DAgger(数据集聚合)要求专家在策略控制系统时逐步报出应该做的动作,但人不在真正控制车或机器人时,很难给出准确标签,也不安全。HG-DAgger 改为由人决定何时介入:平时由学出来的策略控制,人看到它进入危险区域就接管,把系统开回安全状态再交还控制权;只有接管期间人的观测-动作对会加入数据集,然后用聚合后的数据重新训练策略。论文还用多个网络的集成分歧估计策略的不确定度,并从人工介入时刻学出一个风险阈值。实验在仿真和真实自动驾驶车上进行。人工接管、收集纠偏数据的做法如今是真机后训练里常见的人在回路流程。
例子自动驾驶策略在测试车上开,快压线时安全员接手方向盘把车拉回车道中央,这段纠正数据被加进训练集。
- 也叫
- 人类门控 DAgger
- 相关
- DAgger(数据集聚合)、人在回路、复合误差、干预数据、纠偏数据、交互式模仿学习
- 来源
- HG-DAgger: Interactive Imitation Learning with Human Experts (arXiv 1810.02890)