稀疏奖励
Sparse Reward常用只在完成任务等少数时刻给奖励,其余时间奖励都是 0。
稀疏奖励指环境绝大部分时间奖励为零,只有达成目标时才给信号,最典型的是二值奖励:成功记 1,否则记 0。好处是定义简单、不易被钻空子,直接对应「任务到底完成没有」;难点是智能体随机探索时很难碰巧成功,长时间拿不到任何学习信号,任务越长越难。常见对策有:用奖励塑形补充中间提示(相对的做法叫稠密奖励)、用人类演示给出成功样例、后见之明经验回放(HER,把失败轨迹实际到达的位置当作目标重新标注,从而变成「成功」样本)、课程学习由易到难。真机强化学习里常训练一个成功检测器来自动给出这种 0/1 奖励。
例子HIL-SERL 为每个任务遥操作采集约 200 个成功画面和 1000 个失败画面,训练一个二分类器当奖励:只有分类器判定任务完成时给正奖励,其余为 0;分类器在评估集上的准确率一般超过 95%。
- 也叫
- 二值奖励、成功奖励、Binary Reward
- 相关
- 稠密奖励、奖励塑形、后见之明经验回放、成功检测器、探索与利用、HIL-SERL
- 来源
- Hindsight Experience Replay (arXiv 1707.01495)
Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning (HIL-SERL)