高斯策略
Gaussian Policy进阶网络输出动作的均值和标准差,再从正态分布里采样动作的随机策略。
高斯策略是连续动作强化学习里最常用的随机策略形式。神经网络根据观测输出每个动作维度的均值;标准差或者也由网络输出,或者作为不依赖观测的独立可学习参数,常以对数形式存储以保证为正。动作按「均值 + 标准差 × 标准正态噪声」采样,各维一般假设相互独立,所以也叫对角高斯策略。它的对数概率有解析式,方便算策略梯度,标准差大小直接决定探索幅度。PPO、SAC 等主流算法都用它,足式机器人运控的强化学习几乎都是这种策略。部署时通常直接取均值当动作。它只有一个峰,表示不了几种截然不同的合理动作,所以模仿学习里常被 GMM、扩散策略取代。
例子在 Isaac Lab 里用 rsl_rl 的 PPO 训练四足行走:策略输出 12 个关节目标角的均值,再配一组可学习的标准差来采样探索;上真机时只用均值。
- 也叫
- 高斯动作头、对角高斯策略、Diagonal Gaussian Policy
- 相关
- 策略、确定性策略 / 随机策略、近端策略优化、软演员-评论家、熵正则化、连续动作回归
- 来源
- OpenAI Spinning Up: Key Concepts in RL (Diagonal Gaussian Policies)
leggedrobotics/rsl_rl (GitHub)
Soft Actor-Critic (Haarnoja et al., ICML 2018)