信用分配
Credit Assignment进阶最终拿到奖励或惩罚时,判断之前哪些动作该记功、哪些该担责。
信用分配问题在 Marvin Minsky 1961 年的综述《Steps Toward Artificial Intelligence》中就被专门讨论:一个复杂策略成功了,功劳该如何分给其中涉及的众多决策。他举的例子是,赢一盘棋可能涉及上百万个决策,能不能每个决策平分百万分之一的功劳。在强化学习里它主要指时间上的信用分配:奖励常常延迟到任务结束才出现,中间还混着噪声和偶然因素,智能体要从有限的经验中学出每个动作对最终结果的影响。常用手段包括时序差分学习与自举、折扣因子、优势函数和广义优势估计(GAE)、奖励塑形(加中间奖励)、分层强化学习等。机器人长程任务动作步数多、奖励稀疏,信用分配是强化学习在这里难用的主要原因之一。
例子机械臂叠 5 块积木,只有全部叠好才得 1 分。某一回合失败了,原因可能是第 2 块放歪、也可能是第 4 块松手太早;信用分配要从大量这样的回合里学出每一步动作各该负多少责任。
- 也叫
- 贡献度分配、信用分配问题、Credit Assignment Problem、CAP
- 相关
- 稀疏奖励、时序差分学习、优势函数、广义优势估计、奖励塑形、长程任务
- 来源
- A Survey of Temporal Credit Assignment in Deep Reinforcement Learning (arXiv 2312.01072)
Minsky (1961): Steps Toward Artificial Intelligence (Proceedings of the IRE)