具身智能新手名词表English

Cosmos Policy

Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning进阶

把视频生成模型直接微调成机器人策略,同时预测动作、未来画面和成功把握。

英伟达与斯坦福 2026 年 1 月提出,一作 Moo Jin Kim(也是 OpenVLA-OFT 一作),收录于 ICLR 2026。它以视频生成模型 Cosmos-Predict2-2B 为底座,不改结构、不加动作头,只在机器人演示数据上做一次后训练:把本体状态、动作块和价值(预期回报)都编码成「隐帧」,插进视频扩散模型的隐空间序列,和图像帧一起去噪生成。于是模型一次给出三样东西:要执行的动作、执行后的未来画面、这一步成功的把握。推理时可以直接执行动作,也可以采样多个候选、用预测的未来和价值挑最好的(测试时规划)。LIBERO 平均成功率 98.5%,RoboCasa 67.1%(每任务 50 条演示),是「视频模型直接当策略」路线的代表。

例子在 ALOHA 双臂真机任务(如把糖果装进密封袋)中,规划模式下 Cosmos Policy 先采样 8 个候选动作块,再用自己预测的未来画面和价值打分,挑最有把握的那个执行。

也叫
Cosmos 策略
相关
Cosmos Predict、视频生成模型、世界动作模型、价值函数、OpenVLA-OFT、LIBERO
来源
Cosmos Policy (arXiv:2601.16163)
Cosmos Policy 项目主页(NVIDIA Research)
信息截至
2026-01

在完整名词表里查看 →