生数 Vidar
Vidar: VIdeo Diffusion for Action Reasoning (Tsinghua & ShengShu)Vidar进阶先用视频扩散模型预测未来画面、再反推动作的机器人操作模型
清华大学朱军团队(TSAIL)2025 年 7 月发布,名字取自 VIdeo Diffusion for Action Reasoning;真机实验以生数科技的视频模型 Vidu 2.0 为基座,论文注明部分工作在生数完成,据报道由生数与清华联合推出。思路分两步:视频扩散模型先根据指令和当前画面「想象」接下来的视频;再由掩码逆动力学模型(MIDM,根据前后帧反推动作)把视频翻译成机器人动作,它会自动学出只关注机械臂等与动作相关的像素,以屏蔽背景干扰。视频模型先用 3 个机器人平台、75 万条多视角轨迹做具身领域的继续预训练。换到没见过的机器人上,论文称只需约 20 分钟人类演示即可超过基线,并能泛化到新任务、新背景和新相机布局。
例子给一台新的 Aloha 双臂机器人只采约 20 分钟人类演示做适配,Vidar 就能根据新的语言指令先生成完成任务的视频,再由逆动力学模型把视频逐段翻译成关节动作去执行。
- 也叫
- Vidar: Embodied Video Diffusion Model for Generalist Manipulation
- 相关
- 视频生成模型、逆动力学模型、视频预测策略、跨本体、世界动作模型、生数科技
- 来源
- Vidar (arXiv 2507.12898)
Vidar 论文 HTML v4(机构与 Vidu 2.0 基座)
Vidar & AnyPos project page - 信息截至
- 2025-12