具身智能新手名词表English

世界动作模型

World Action ModelWAM常用

同时预测未来画面和机器人动作,用对世界的预测来指导动作的模型。

世界动作模型这个名称由 NVIDIA 2026 年 2 月的 DreamZero 论文正式提出:凡是利用世界建模能力(预测未来状态)来预测动作的模型都叫 WAM,此前的 GR-1、UWM、Cosmos Policy 等视频-动作联合模型也被归入其中。典型做法是以预训练视频生成模型为骨干,加上动作输入输出,训练时同时预测未来视频和动作。和从视觉语言模型出发的 VLA 相比,它从视频里学物理动态,DreamZero 报告对新任务、新环境的泛化比当时最好的 VLA 高一倍多。不叫视频动作模型,是因为预测对象将来也可以是触觉或力。未决问题是推理时是否真要生成未来画面:Fast-WAM 只在训练时联合预测视频、推理时跳过,效果相近而快 4 倍以上。

例子DreamZero 以 Wan2.1 图生视频 14B 模型为骨干,输入相机画面和语言指令,同时生成未来视频和动作,在真机上以 7Hz 实时控制。

也叫
World-Action Model、视频动作模型、Video-Action Model、VAM
相关
视觉-语言-动作模型、世界模型、视频生成模型、DreamZero、Fast-WAM、视频预测策略
来源
World Action Models are Zero-shot Policies (DreamZero, arXiv 2602.15922)
Fast-WAM: Do World Action Models Need Test-time Future Imagination? (arXiv 2603.16666)
信息截至
2026-03

在完整名词表里查看 →