Cosmos Policy
Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning进阶把视频生成模型直接微调成机器人策略,同时预测动作、未来画面和成功把握。
英伟达与斯坦福 2026 年 1 月提出,一作 Moo Jin Kim(也是 OpenVLA-OFT 一作),收录于 ICLR 2026。它以视频生成模型 Cosmos-Predict2-2B 为底座,不改结构、不加动作头,只在机器人演示数据上做一次后训练:把本体状态、动作块和价值(预期回报)都编码成「隐帧」,插进视频扩散模型的隐空间序列,和图像帧一起去噪生成。于是模型一次给出三样东西:要执行的动作、执行后的未来画面、这一步成功的把握。推理时可以直接执行动作,也可以采样多个候选、用预测的未来和价值挑最好的(测试时规划)。LIBERO 平均成功率 98.5%,RoboCasa 67.1%(每任务 50 条演示),是「视频模型直接当策略」路线的代表。
例子在 ALOHA 双臂真机任务(如把糖果装进密封袋)中,规划模式下 Cosmos Policy 先采样 8 个候选动作块,再用自己预测的未来画面和价值打分,挑最有把握的那个执行。
- 也叫
- Cosmos 策略
- 相关
- Cosmos Predict、视频生成模型、世界动作模型、价值函数、OpenVLA-OFT、LIBERO
- 来源
- Cosmos Policy (arXiv:2601.16163)
Cosmos Policy 项目主页(NVIDIA Research) - 信息截至
- 2026-01