稠密奖励
Dense Reward常用几乎每一步都给反馈、告诉智能体离目标更近还是更远的奖励设计。
稠密奖励指强化学习中几乎每个时间步都给出有信息量的奖励,与只在任务成功时才给奖励的稀疏奖励相对。它通常由人把任务拆成若干项加权相加,如到目标的距离、速度跟踪误差、能耗惩罚。好处是智能体从一开始就知道往哪个方向改进,学得快;腿足运控的强化学习几乎都用稠密奖励。代价是设计费力,各项权重没调好时,智能体会钻空子刷分而不完成真正的目标,即奖励黑客。Eureka 等工作尝试让大模型自动写这类奖励函数代码。
例子Gymnasium-Robotics 的 FetchReach 有两个版本:稀疏版在末端离目标超过 5 厘米时每步给 -1、到达给 0;稠密版 FetchReachDense 每步给末端到目标的负欧氏距离。legged_gym 的四足行走奖励由速度跟踪、关节力矩惩罚、碰撞惩罚等多项组成,每个仿真步都计算。
- 也叫
- 密集奖励、稠密回报
- 相关
- 稀疏奖励、奖励塑形、奖励函数、奖励工程、奖励黑客、Eureka
- 来源
- Gymnasium-Robotics: Fetch Reach
Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning (arXiv 2109.11978)