QT-Opt
QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation进阶谷歌用 58 万多次真机抓取训练视觉 Q 函数的大规模强化学习抓取系统
Google Brain 与 X 的 Dmitry Kalashnikov、Sergey Levine 等人 2018 年 6 月发布,发表于 CoRL 2018。当时抓取多是先选抓取点再开环执行。QT-Opt 用深度强化学习直接从头顶 RGB 相机图像学一个 Q 函数,每一步都按当前画面重新决定夹爪怎么动,实现闭环抓取;连续动作难以直接求最大值,就用交叉熵方法(迭代采样优化)搜索最优动作。训练用了 58 万多次真实抓取尝试,在没见过的物体上抓取成功率达 96%,还自发学会重新抓取、先拨动物体再抓等行为。它是大规模真机强化学习的代表作,MT-Opt、Q-Transformer 都沿此发展。
例子物体在抓取过程中被人推开时,QT-Opt 策略会根据新的相机画面调整夹爪位置重新抓,而不是按原计划在空处合拢。
- 相关
- Q-Transformer、MT-Opt、真机强化学习、Q 函数、交叉熵方法、Google 机械臂农场(大规模抓取自监督)
- 来源
- QT-Opt (arXiv 1806.10293)
- 信息截至
- 2018-06