UVA
Unified Video Action Model进阶视频和动作共用一个潜在表示、推理时可跳过视频生成的机器人模型
斯坦福大学 Shuang Li、Yihuai Gao、Dorsa Sadigh、宋舒然 2025 年 2 月发布,发表于 RSS 2025。用视频生成做机器人策略能学到环境会怎么变化,但动作精度和推理速度往往不如直接输出动作的策略。UVA 让视频和动作共享一个联合潜在表示,训练时一起学,解码时分开:用两个轻量扩散头分别解出未来画面和动作,推理时可以跳过视频生成、只解动作,所以速度快。再配合掩码训练,同一个模型可以当策略、正向动力学模型、逆动力学模型或视频预测模型用。在叠毛巾、摆杯子等真机多任务实验里,它在没见过的环境和物体上优于基于 UMI 数据训练的扩散策略基线。
例子机器人叠毛巾时,UVA 只解码下一段动作、跳过画面生成来保证实时;离线分析时,同一个模型也能根据给定动作预测执行后的画面。
- 也叫
- Unified Video Action Model
- 相关
- 视频预测策略、世界动作模型、正向动力学模型、逆动力学模型、扩散策略、通用操作接口
- 来源
- Unified Video Action Model (arXiv 2503.00200)
UVA project page - 信息截至
- 2025-04