WMPO(基于世界模型的策略优化)
WMPO: World Model-based Policy Optimization for Vision-Language-Action ModelsWMPO进阶让 VLA 在视频世界模型「想象」的轨迹里做强化学习,不用碰真机
香港科技大学与字节跳动 Seed 的研究者 2025 年 11 月提出。VLA 只靠专家演示学习,学不会从失败中纠正;直接在真机上做强化学习又太费样本。WMPO 先训练一个预测像素画面的视频世界模型,让 VLA 在模型「想象」出的轨迹里反复试做,再用同策略的 GRPO(组相对策略优化:同一任务采多条轨迹互相比较打分)更新策略,全程不与真实环境交互。选像素而不是隐空间,是为了让想象画面和 VLA 在网络图像上预训练的视觉特征对得上。实验以 OpenVLA-OFT 为基础策略,在 MimicGen 仿真任务和 Mobile ALOHA 真机上都优于 GRPO、DPO 基线,并出现自我纠错行为。
例子真机「把方块插到杆上」任务(间隙 5 毫米)中,基础策略成功率 53%,DPO 为 60%,WMPO 提到 70%(各 30 次试验)。
- 也叫
- World-Model-based Policy Optimization
- 相关
- 世界模型、强化学习微调、组相对策略优化、想象中学习、OpenVLA-OFT、VLA-RFT
- 来源
- WMPO (arXiv:2511.09515)
WMPO 项目主页 - 信息截至
- 2025-11