自博弈
Self-Play进阶让智能体和自己(或自己的历史版本)对战,从胜负中不断变强。
自博弈是多智能体强化学习中的一种训练方式:对手不是人或固定脚本,而是智能体自己的当前或历史版本。自己变强,对手也同步变强,相当于自动生成难度递增的课程,而且不需要人类对局数据。最著名的是 DeepMind 2017 年的 AlphaGo Zero:从随机落子开始,只靠自我对弈加蒙特卡洛树搜索,训练 3 天后以 100:0 战胜此前击败人类冠军的 AlphaGo 版本。机器人里,对抗类任务常用它,例如 DeepMind 让小型人形机器人 OP3 学一对一踢球:先分别训练起身和进球技能,再把两者蒸馏进一个策略,并与自己的历史快照对抗。只和最新的自己打容易来回兜圈子,所以通常从历史版本池里抽对手。
例子OP3 踢球训练中,对手从智能体自身定期保存的历史快照池中抽取;消融实验显示,去掉自博弈训练的智能体即使面对固定对手也表现更差。
- 也叫
- 自我对弈、自对弈
- 相关
- 多智能体强化学习、强化学习、蒙特卡洛树搜索、课程学习、基于群体的训练、OP3 足球(DeepMind 双足踢球)
- 来源
- Google DeepMind Blog: AlphaGo Zero: Starting from scratch
Haarnoja et al. 2023: Learning Agile Soccer Skills for a Bipedal Robot with Deep Reinforcement Learning