在线策略蒸馏
On-Policy DistillationOPD进阶学生模型自己生成轨迹,老师在这些轨迹的每一步上打分纠正的蒸馏方法。
普通知识蒸馏让学生模仿老师事先生成好的数据,可学生部署时会走到老师数据里没有的状态,错误逐步累积,这和行为克隆的复合误差是同一个问题。在线策略蒸馏改为让学生自己采样生成,再由老师在学生实际走到的每一步(每个 token 或每个动作)上给出目标分布,常用反向 KL 散度衡量差距,思路与 DAgger 一脉相承。Google DeepMind 的 Agarwal 等人 2023 年以 GKD 系统提出这一做法;Thinking Machines 2025 年 10 月的博客让它在大模型后训练中广为人知,它的反馈比强化学习的稀疏奖励稠密得多。2026 年的 VLA-OPD 把它用到 VLA 后训练,用专家老师的逐步监督替代稀疏的环境奖励。
例子据 Thinking Machines 博客引用的 Qwen3 技术报告,在线策略蒸馏在 AIME'24 上拿到 74.4 分、约用 1800 GPU 时;直接做强化学习只有 67.6 分,却用了约 17920 GPU 时。
- 也叫
- 同策略蒸馏、广义知识蒸馏(GKD)
- 相关
- 知识蒸馏、策略蒸馏、DAgger(数据集聚合)、教师-学生蒸馏、强化学习微调、VLA-OPD
- 来源
- Thinking Machines Lab (Kevin Lu), 2025-10-27: On-Policy Distillation
Agarwal et al. 2023: On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes (GKD)
VLA-OPD: Bridging Offline SFT and Online RL for VLA Models via On-Policy Distillation (arXiv 2603.26666) - 信息截至
- 2026-03