Cosmos 3
Cosmos 3: Omnimodal World Models for Physical AI进阶英伟达第三代全模态世界模型:一个模型既能理解、生成视频,也能输出动作。
英伟达 Cosmos 世界基础模型家族的第三代,2026 年 5 月发布,技术报告 2026 年 6 月上 arXiv。前两代把理解(Cosmos Reason)和视频生成(Cosmos Predict)分成不同模型;Cosmos 3 用混合 Transformer(MoT)架构把它们合进一个模型:自回归的语言塔负责读文字、做推理,扩散的生成塔负责输出图像、视频、音频和动作序列,两塔共享注意力。同一套权重可以当视觉语言模型、文生/图生视频模型、按动作预测未来画面的世界模拟器,也能后训练成机器人策略。开放 Super(64B)和 Nano(16B)两档,2026 年 7 月又放出面向 Jetson 端侧的 Edge(4B),代码和权重采用 OpenMDW-1.1 许可。
例子据技术报告,用 DROID 数据后训练出的 Cosmos3-Nano-Policy 在 RoboArena 真机评测榜(2026-05-30 快照)上以 Elo 1870 排名第一。
- 也叫
- Cosmos3、英伟达 Cosmos 3
- 相关
- Cosmos、世界基础模型、混合 Transformer 架构、统一多模态模型、世界动作模型、Cosmos Policy
- 来源
- Cosmos 3: Omnimodal World Models for Physical AI (arXiv:2606.02800)
NVIDIA Cosmos GitHub(Cosmos 3 模型家族与发布记录) - 信息截至
- 2026-07