优势函数
Advantage Function常用衡量某个动作比按当前策略的平均水平好多少,等于 Q 值减 V 值。
优势函数定义为 A(s,a) = Q(s,a) − V(s):Q 是在状态 s 先做动作 a、之后按策略行动的期望回报,V 是在状态 s 直接按策略行动的期望回报。两者相减就是这个动作「比平均好多少」,为正说明该多做,为负说明该少做。策略梯度方法用优势代替原始回报,能明显降低梯度估计的方差(波动),训练更稳。PPO 等算法常用 Schulman 等人 2015 年提出的广义优势估计(GAE)来算它;Physical Intelligence 的 RECAP 则把优势作为条件输入 VLA,让模型区分好经验和差经验。
例子机械臂抓杯子时,在状态 s 下按当前策略平均能拿到 0.6 的回报;如果先执行「垂直下探」再继续,期望回报是 0.8,那么这个动作的优势就是 +0.2,训练会提高它被选中的概率。
- 也叫
- 优势值、Advantage、A(s,a)
- 相关
- 价值函数、Q 函数、广义优势估计、策略梯度、近端策略优化、RECAP
- 来源
- OpenAI Spinning Up: Key Concepts in RL
High-Dimensional Continuous Control Using Generalized Advantage Estimation (arXiv 1506.02438)