具身智能新手名词表English

广义优势估计

Generalized Advantage EstimationGAE进阶

把多步时序差分误差按 λ 指数加权相加,来估计优势函数。

GAE 由 Schulman、Levine、Abbeel 等人在 2015 年提出。策略梯度需要知道某个动作比平均水平好多少,即优势函数。只用一步时序差分(TD)误差 δ = r + γV(s′) − V(s) 估计,方差小但偏差大;用整个回合的蒙特卡洛回报,偏差小但方差大。GAE 把未来各步 TD 误差按 (γλ)^k 衰减加权求和,λ 在 0 到 1 之间调节两者折中:λ = 0 即一步 TD,λ = 1 即蒙特卡洛,思路与 TD(λ) 相同。它是 PPO 的标准配置,足式和人形机器人的 PPO 运控训练普遍用它算优势。

例子legged_gym 的 PPO 默认配置取折扣因子 γ = 0.99、GAE 参数 λ = 0.95。

也叫
GAE(λ)、广义优势函数估计
相关
优势函数、近端策略优化、时序差分学习、折扣因子、价值函数、策略梯度
来源
High-Dimensional Continuous Control Using Generalized Advantage Estimation (arXiv:1506.02438)
legged_gym: legged_robot_config.py

在完整名词表里查看 →