回报条件化
Return Conditioning进阶把「想拿多少回报」当输入给策略,让它照着目标回报去行动。
回报条件化是把强化学习改写成监督学习的一种做法:训练时把每条轨迹从当前步起剩余的累计奖励(return-to-go)和观测一起输入策略,让它模仿这条轨迹里实际做的动作;测试时输入一个较高的目标回报,希望它做出高回报的行为。Schmidhuber 2019 年的倒置强化学习(Upside-Down RL)和 2021 年的决策 Transformer 是代表,后者用 Transformer 把回报、状态、动作排成序列来预测动作,在离线强化学习基准上与主流方法相当。它不用学价值函数,训练稳定;但 Brandfonbrener 等人 2022 年指出,在随机性强或数据覆盖不足时它可能学不到最优策略。π*0.6 所用 RECAP 的优势条件化是同一思路的变体。
例子决策 Transformer 测试时先给定目标回报(如任务成功记为 1),每执行一步就把目标减去实际拿到的奖励,再以剩下的目标回报为条件预测下一个动作。
- 也叫
- 回报条件策略、Return-Conditioned Policy、回报条件监督学习、Return-Conditioned Supervised Learning (RCSL)
- 相关
- 决策 Transformer、优势条件化、回报、离线强化学习、RECAP、目标条件策略
- 来源
- Chen et al. 2021: Decision Transformer: Reinforcement Learning via Sequence Modeling
Schmidhuber 2019: Reinforcement Learning Upside Down: Don't Predict Rewards -- Just Map Them to Actions
Brandfonbrener et al. 2022: When does return-conditioned supervised learning work for offline reinforcement learning?