熵坍缩 / 模式坍缩
Entropy Collapse / Mode Collapse进阶模型输出的多样性塌缩,只会给出少数几种答案或动作。
两个词说的是同一类现象。模式坍缩最早用于 GAN(生成对抗网络):Goodfellow 在 2016 年教程中描述,生成器把不同输入噪声映射到同一类输出,只覆盖数据分布里的一两个「模式」。熵坍缩多用于强化学习:策略的熵(随机程度)在训练早期迅速下降,模型几乎只输出一种行为、不再探索,性能随之见顶;Cui 等人 2025 年在大模型推理强化学习中系统分析了它,并提出 Clip-Cov、KL-Cov 来维持熵。机器人动作本有多峰性,VLA 做强化学习微调时常用提高采样温度、放宽裁剪上界、加熵奖励等办法缓解坍缩。
例子SimpleVLA-RL 在对 OpenVLA-OFT 做 GRPO 强化学习时,用动态采样、调高 PPO 式裁剪的上界(参考 DAPO 的 Clip-Higher)和提高推演采样温度三项改动来加强探索。
- 也叫
- 策略熵坍缩、模式崩塌、模式崩溃、Policy Entropy Collapse、Helvetica Scenario
- 相关
- 熵正则化、探索与利用、生成对抗网络、动作多峰性、组相对策略优化、SimpleVLA-RL
- 来源
- NIPS 2016 Tutorial: Generative Adversarial Networks (arXiv:1701.00160)
The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models (arXiv:2505.22617)
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning (arXiv:2509.09674)