端到端视觉运动策略(引导策略搜索)
End-to-End Training of Deep Visuomotor Policies (Guided Policy Search)GPS进阶伯克利 2015 年的代表作:用卷积网络直接从相机图像输出机械臂关节力矩。
这篇论文由 UC 伯克利的 Sergey Levine、Chelsea Finn、Trevor Darrell 和 Pieter Abbeel 于 2015 年 4 月放出,2016 年发表于 JMLR。当时机器人多把感知和控制分开设计,论文要验证两者放进一个网络联合训练是否更好。策略是约 9.2 万参数的卷积网络,输入单目图像和关节状态,以 20Hz 输出 7 自由度手臂的关节力矩。训练用引导策略搜索:训练时已知物体位置,先用轨迹优化找出好动作,再用监督学习让只看图像的策略去模仿,把强化学习转成监督学习。文中提出的空间 Softmax 层后来被许多视觉运动策略沿用。
例子PR2 机器人学会了把衣架挂上衣杆、把积木塞进形状分类盒、用玩具锤的羊角卡住钉子、拧瓶盖,目标位置全靠摄像头判断;每个策略总训练 3 到 4 小时,真机执行只占约 15 分钟。
- 也叫
- 引导策略搜索、Guided Policy Search、Levine et al. 2016
- 相关
- 视觉运动策略、端到端、空间 Softmax、轨迹优化、强化学习、模仿学习
- 来源
- End-to-End Training of Deep Visuomotor Policies (arXiv 1504.00702)
JMLR 17(39):1-40, 2016