离线强化学习
Offline Reinforcement LearningOffline RL常用只用事先收集好的固定数据集训练策略,训练中不再与环境交互。
早期也叫批量强化学习。Sergey Levine 等人 2020 年的综述将其定义为:只利用预先收集的数据、不做额外在线采集的强化学习。数据可以来自人类遥操作、旧策略或部署日志,训练全程不碰真实环境,适合试错昂贵或危险的机器人、医疗等场景。和模仿学习不同,它利用奖励信号,有机会从好坏混杂的次优数据里学出比数据本身更好的策略。核心难点是分布偏移:策略一旦选了数据里没出现过的动作,Q 函数对它的估值往往虚高(外推误差),错误还会逐步累积。保守 Q 学习(CQL)、隐式 Q 学习(IQL)和各类策略约束方法都是为此设计的。
例子保守 Q 学习(CQL)在普通 Q 学习上加一个正则项,故意压低数据集外动作的 Q 值,让学到的价值成为真实价值的下界,避免策略被虚高的估值带偏。
- 也叫
- 批量强化学习、Batch RL、Batch Reinforcement Learning
- 相关
- 在线强化学习、异策略、保守 Q 学习、隐式 Q 学习、离线到在线强化学习、D4RL 离线强化学习基准
- 来源
- Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems (Levine et al., 2020)
Conservative Q-Learning for Offline Reinforcement Learning