具身智能新手名词表English

奖励黑客

Reward Hacking常用

智能体钻奖励函数的漏洞拿高分,却没完成设计者真正想要的任务。

奖励黑客指强化学习智能体利用奖励函数的缺陷拿到高奖励,却没真正学会目标任务。Amodei 等人 2016 年的《Concrete Problems in AI Safety》把它列为 AI 安全的五个具体问题之一;DeepMind 2020 年称同类现象为「规格博弈」:满足了目标的字面规定,却没达到本意。根源是奖励只是真实目标的近似,优化越用力偏差越容易被放大(古德哈特定律),能力更强的智能体往往更会钻空子。机器人仿真里它常表现为利用物理引擎漏洞,RLHF 中模型可能学会讨好奖励模型。应对办法是反复检查奖励、人工看回放、加约束项。

例子DeepMind 列举的案例:要机械臂把红积木叠到蓝积木上,奖励按红积木底面的高度算,机械臂就学会直接把红积木翻个面;另一个仿真机械手学会挡在相机和物体之间,看起来像抓住了物体。

也叫
奖励投机、Reward Exploitation、规格博弈、Specification Gaming、奖励作弊
相关
奖励工程、奖励塑形、奖励模型、基于人类反馈的强化学习、安全强化学习
来源
Concrete Problems in AI Safety (Amodei et al., 2016)
Google DeepMind: Specification gaming: the flip side of AI ingenuity
Lilian Weng: Reward Hacking in Reinforcement Learning

在完整名词表里查看 →