具身智能新手名词表English

Fast-WAM

Fast-WAM: Do World Action Models Need Test-time Future Imagination?进阶

清华与星海图 2026 年的世界动作模型:训练时学预测视频,推理时跳过想象,更快。

Fast-WAM 是清华大学交叉信息研究院与星海图的 Tianyuan Yuan、赵行(Hang Zhao)等人 2026 年 3 月发布的论文。世界动作模型(WAM,同时预测未来画面和机器人动作的模型)多数走「先想象再执行」路线:先用视频扩散模型生成未来几帧,再据此出动作,反复去噪让推理很慢。作者把两件事拆开做对照:训练时要不要联合学视频预测,推理时要不要真的生成未来画面。结论是去掉推理时的想象几乎不掉点,去掉训练时的视频联合训练则明显变差,说明视频预测的价值主要在于训练出更好的世界表征。模型以 Wan2.2-5B 视频扩散 Transformer 为骨干,加约 10 亿参数的动作专家,共约 60 亿参数;推理延迟 190 毫秒,比同类「先想象再执行」模型快 4 倍以上。

例子不做任何机器人数据预训练,Fast-WAM 在 RoboTwin 2.0 上成功率 91.8%,在 LIBERO 上平均 97.6%,并在星海图 R1 Lite 上完成真机长程叠毛巾任务。

相关
世界动作模型、视频生成模型、动作专家、推理延迟、蚂蚁灵波 LingBot-VA、Motus
来源
Fast-WAM: Do World Action Models Need Test-time Future Imagination? (arXiv 2603.16666)
信息截至
2026-03

在完整名词表里查看 →