熵正则化
Entropy Regularization进阶在训练目标里加一项策略熵的奖励,鼓励策略保持随机、多做探索。
熵衡量一个概率分布有多随机:均匀分布熵高,几乎确定的分布熵低。熵正则化在强化学习目标里加上 α 乘以策略熵(α 是权重系数),让智能体在追求回报的同时保留一定随机性,避免过早收敛到次优行为。常见用法有两种:一是在 PPO 等策略梯度算法的损失里加一个小的熵奖励项;二是把熵直接写进优化目标,形成最大熵强化学习,代表是 Haarnoja 等人 2018 年提出的 SAC(软演员-评论家),它的 Q 值目标里也带熵项。α 太大,策略会一直乱动;太小,又容易熵坍缩、过早停止探索。
例子legged_gym 默认的 PPO 配置里熵系数 entropy_coef 设为 0.01,即在损失中加入 0.01 倍的策略熵奖励。
- 也叫
- 最大熵强化学习、熵奖励、熵正则、Entropy Bonus、Maximum Entropy RL
- 相关
- 软演员-评论家、近端策略优化、探索与利用、熵坍缩 / 模式坍缩、KL 正则化、确定性策略 / 随机策略
- 来源
- OpenAI Spinning Up: Soft Actor-Critic (Entropy-Regularized RL)
Soft Actor-Critic: Off-Policy Maximum Entropy Deep RL with a Stochastic Actor (arXiv:1801.01290)
legged_gym: legged_robot_config.py