具身智能新手名词表English

DreamDojo

DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos进阶

英伟达 2026 年发布的通用机器人世界模型,用约 4.4 万小时人类视频预训练。

DreamDojo 是英伟达牵头、联合 UC Berkeley、港科大、斯坦福等于 2026 年 2 月发布的通用机器人世界模型(能根据动作预测未来画面的模型)。机器人数据少且贵,人做事的视频很多却没有动作标签。DreamDojo 整理了约 4.47 万小时的第一人称人类视频(主体是自建的众包数据集 DreamDojo-HV,约 4.38 万小时,另含 EgoDex 和少量实验室数据),论文称是当时最大的世界模型预训练视频集;它用从视频中学出的连续潜在动作充当统一的「代理动作」,让模型先从无标签视频里学物体交互规律,再用机器人数据后训练,变成能接收真实动作指令的模拟器。模型基于 Cosmos-Predict2.5,有 2B 和 14B 两个版本,蒸馏后在 H100 上约 10.8 帧每秒实时生成,可用于策略评测、实时遥操作和基于模型的规划。

例子后训练后适配了傅利叶 GR-1、宇树 G1、智元和 YAM 等机器人:给定当前画面和一串动作,模型实时生成执行后的视频,可在不上真机的情况下评估策略好坏。

相关
世界模型、潜在动作、第一人称视频、EgoDex 数据集、Cosmos Predict、世界模型评测
来源
DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos (arXiv 2602.06949)
DreamDojo 项目主页
信息截至
2026-02

在完整名词表里查看 →