DPPO(扩散策略策略优化)
Diffusion Policy Policy OptimizationDPPO进阶用 PPO 策略梯度直接强化学习微调扩散策略,把每一步去噪也当成决策步骤。
DPPO 由普林斯顿大学 Allen Z. Ren 等人联合 MIT、丰田研究院、卡内基梅隆大学、哈佛大学的研究者于 2024 年 9 月提出,发表于 ICLR 2025。扩散策略靠模仿学习训练,效果受限于演示质量;策略梯度类强化学习(如 PPO)需要算动作概率,而扩散模型多步去噪不好直接算,此前普遍认为这样微调效率低。DPPO 把过程拆成两层马尔可夫决策过程:外层是和环境交互,内层把每一步去噪看成一次高斯采样的「动作」,每步概率都能算,于是可以用 PPO 端到端微调。实验显示它探索贴近演示数据分布、训练稳定、微调后更鲁棒,是扩散和流匹配策略做强化学习微调的常用基线。
例子在 Furniture-Bench 家具装配仿真任务上,DPPO 把预训练扩散策略的成功率从 57% 提到 97%(One-Leg)、从 12% 提到 87%(Lamp),装配策略还能零样本迁移到真机。
- 也叫
- 扩散策略策略优化
- 相关
- 扩散策略、近端策略优化、强化学习微调、策略梯度、仿真到现实迁移、ReinFlow
- 来源
- Diffusion Policy Policy Optimization (arXiv:2409.00588)
DPPO 项目主页
Allen Z. Ren 个人主页(论文列表,标注 ICLR 2025) - 信息截至
- 2025