基于人类反馈的强化学习
Reinforcement Learning from Human FeedbackRLHF常用让人比较模型输出的好坏,据此训练奖励模型,再用强化学习按人的偏好优化模型。
RLHF 由 Christiano 等人(OpenAI 与 DeepMind)2017 年提出:人只需比较两段轨迹哪段更好,就能学出奖励函数,所需人工反馈不到交互量的 1%。2022 年 OpenAI 的 InstructGPT 把它用于大语言模型,分三步:监督微调;用人对多个回答的排序训练奖励模型;用 PPO 优化模型并加 KL 惩罚防止偏离原模型,ChatGPT 沿用了这套流程。它适合「难写成公式、但人一看就能判断」的目标,缺点是标注贵,模型还可能钻奖励模型的空子。DPO 跳过奖励模型直接用偏好数据训练;具身领域的 GRAPE 用轨迹级偏好对齐 VLA。
例子InstructGPT 的人工评测中,经过 RLHF、只有 13 亿参数的模型,回答比 1750 亿参数的 GPT-3 更受偏好。
- 也叫
- 人类反馈强化学习、偏好优化、偏好对齐、Preference Alignment
- 相关
- 奖励模型、直接偏好优化、近端策略优化、KL 正则化、奖励黑客、GRAPE
- 来源
- Deep Reinforcement Learning from Human Preferences (Christiano et al., 2017)
Training language models to follow instructions with human feedback (InstructGPT)
Wikipedia: Reinforcement learning from human feedback