自动域随机化
Automatic Domain RandomizationADR进阶随策略变强自动扩大随机化范围的域随机化方法,由 OpenAI 提出。
ADR 是 OpenAI 2019 年在「用机器人手解魔方」工作中提出的算法。普通域随机化(在仿真里随机改摩擦、质量、外观等参数,好让策略迁移到真机)要人手动设定每个参数的随机范围,参数一多就很难调。ADR 把它做成自动课程:初始分布只集中在一个按真机标定值设定的环境;训练中随机挑一个参数固定在当前范围的边界上评测,表现高于上阈值就扩大该参数范围,低于下阈值就缩小。这样难度跟着能力增长,最终范围可远超人工设定。论文用它同时训练控制策略和视觉位姿估计网络,全部在仿真里训练后迁移到真实的 Shadow 灵巧手。
例子论文中最好的策略在真机上复原需 15 步拧转的魔方成功率约 60%,需 26 步的最难情形约 20%;复原步骤由传统的 Kociemba 求解器给出,神经网络负责手上的操作。
- 也叫
- 自动化域随机化
- 相关
- 域随机化、动力学随机化、仿真到现实迁移、课程学习、Dactyl(OpenAI 魔方灵巧手)、Shadow 灵巧手
- 来源
- Solving Rubik's Cube with a Robot Hand (OpenAI, arXiv 1910.07113)
- 信息截至
- 2019-10