同策略
On-Policy常用只用当前策略自己刚采集的数据来更新,旧数据用完即弃。
与异策略相对:产生数据的行为策略和正在优化的目标策略是同一个。每次更新参数后,旧策略收集的数据就不再符合当前策略的分布,只能丢掉重新采。SARSA、REINFORCE、A2C/A3C、TRPO、PPO 都是同策略算法;PPO 会在同一批数据上做几轮小批量更新,但仍算同策略。优点是训练稳定、实现简单;缺点是数据利用率低,需要海量交互。GPU 大规模并行仿真把采样变便宜之后,PPO 成了腿足和人形机器人运控训练的主流算法。中文「在线策略」多指同策略,注意和「在线强化学习」区分。
例子Rudin 等人 2021 年在单张 GPU 上并行仿真上千台 ANYmal 四足机器人,平地行走策略不到 4 分钟、崎岖地形约 20 分钟就训好,并迁移到真机;其开源代码 legged_gym 配套的 rsl_rl 就是 PPO 实现。
- 也叫
- 在策略、同轨策略、在线策略、On-Policy Learning
- 相关
- 异策略、近端策略优化、策略梯度、大规模并行强化学习、样本效率、rsl_rl
- 来源
- OpenAI Spinning Up: Kinds of RL Algorithms
Proximal Policy Optimization Algorithms
Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning