策略约束
Policy Constraint (Behavior Regularization)进阶离线强化学习里,限制新策略不要偏离数据中行为策略太远的一类方法。
策略约束是离线强化学习(只用现成数据、不再与环境交互)的一大类方法。Q 函数(估计做某动作能拿多少回报)对数据里没出现过的动作常估得过高,策略去追这些虚高动作就会崩,这叫外推误差。策略约束给策略加一条限制:输出的动作要接近采集数据时的行为策略,可以用 KL 散度、MMD 等距离做惩罚,或在目标里加一项行为克隆损失。BCQ、BEAR、TD3+BC 都属于这一路线,2019 年 Wu、Tucker、Nachum 的 BRAC 把它们统一成「行为正则化」框架。它和保守 Q 学习这类「压低陌生动作价值」的方法是离线 RL 的两条主线。
例子TD3+BC 只在在线算法 TD3 的策略更新里加一项行为克隆损失(让输出动作靠近数据集动作),再把状态做归一化,就达到了与当时复杂离线 RL 算法相当的效果。
- 也叫
- 行为正则化、Behavior Regularization、行为约束
- 相关
- 离线强化学习、外推误差、KL 正则化、行为克隆、保守 Q 学习、优势加权回归
- 来源
- Wu, Tucker, Nachum 2019: Behavior Regularized Offline Reinforcement Learning (BRAC)
Fujimoto & Gu 2021: A Minimalist Approach to Offline Reinforcement Learning (TD3+BC)
Levine et al. 2020: Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems