折扣因子
Discount Factorγ常用强化学习里给未来奖励打折的系数,决定智能体多看重长远回报。
折扣因子是强化学习的基础超参数,写作 γ,取值在 0 到 1 之间。计算回报(从当前时刻起累计的奖励)时,k 步之后的奖励要乘上 γ 的 k 次方。它有两个作用:一是表达「眼前的奖励比远处的更确定、更值钱」;二是让无限长的奖励求和收敛成有限值,方便用贝尔曼方程(价值函数的递推关系)来求解。γ 越接近 1,智能体越看重长远结果,但价值估计也更难、方差更大;γ 越小越短视。机器人强化学习里常取 0.99 左右。它出现在回报、价值函数和优势函数的定义中。
例子legged_gym(ETH 开源的足式机器人强化学习训练框架)的 PPO 配置里 gamma = 0.99:100 步之后的奖励权重约为 0.99 的 100 次方 ≈ 0.37。
- 也叫
- gamma、折扣率
- 相关
- 回报、奖励函数、价值函数、贝尔曼方程、广义优势估计、马尔可夫决策过程
- 来源
- OpenAI Spinning Up: Key Concepts in RL
legged_gym: legged_robot_config.py (PPO gamma = 0.99)