KL 正则化
KL Regularization (KL Penalty)进阶在训练目标里加 KL 散度惩罚,不让新策略偏离参考策略太远。
KL 正则化是在优化目标里加一项 KL 散度(衡量两个概率分布差多少)乘以系数,惩罚当前策略偏离某个参考策略。常见场景有三类:RLHF 中 InstructGPT 对每个 token 加相对监督微调模型的 KL 惩罚,防止模型钻奖励模型的空子;离线强化学习中,BRAC 等方法用 KL 等散度把策略拉在数据的行为策略附近,避免选到数据里没有的动作;TRPO、PPO 则用 KL 限制每次更新的幅度。VLA 的强化学习微调也常用它防止策略跑偏、丢掉预训练能力。系数太大学不动,太小约束失效。
例子InstructGPT 的 PPO 目标是「奖励模型打分 − β·log(π_RL / π_SFT)」,β 越大,新模型越不敢偏离监督微调模型。
- 也叫
- KL 惩罚、KL 约束、KL Penalty
- 相关
- KL 散度、策略约束、离线强化学习、基于人类反馈的强化学习、近端策略优化、奖励黑客
- 来源
- Training language models to follow instructions with human feedback (InstructGPT, arXiv:2203.02155)
Behavior Regularized Offline Reinforcement Learning (BRAC, arXiv:1911.11361)