非对称演员-评论家
Asymmetric Actor-Critic进阶评论家看仿真里的完整状态,演员只看真机上也能拿到的观测。
非对称演员-评论家由 Lerrel Pinto、Marcin Andrychowicz、Pieter Abbeel 等人 2017 年提出。演员-评论家算法里,评论家(价值网络)只在训练时使用、部署时丢掉,所以在仿真训练时可以给它完整的真实状态(物体精确位姿、速度等特权信息),而演员(策略)只接收相机图像等真机上拿得到的输入。评论家估值更准,训练更快更稳,留下的策略又能直接上真机。原论文结合域随机化,在 7 自由度 Fetch 机械臂上不用任何真机数据完成了抓取、推动等任务。OpenAI 的灵巧手项目 Dactyl 也用了这种做法;如今用 PPO 训练足式机器人运动控制时,让评论家额外读取地形、摩擦等特权观测也很常见。
例子Dactyl 训练时,价值网络能读到真机上拿不到的额外信息,策略只用真机可获取的观测,训练好后直接部署到 Shadow 灵巧手上转动方块。
- 也叫
- 非对称 AC、Asymmetric AC、非对称 Actor-Critic
- 相关
- 特权信息、教师-学生蒸馏、价值函数、部分可观测马尔可夫决策过程、仿真到现实迁移、域随机化
- 来源
- Asymmetric Actor Critic for Image-Based Robot Learning (arXiv 1710.06542)
Learning Dexterous In-Hand Manipulation (OpenAI Dactyl, arXiv 1808.00177)