DINO-WM
DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning进阶在 DINOv2 图像特征空间里预测未来的世界模型,训练后能零样本规划到新目标。
DINO-WM 由纽约大学的 Gaoyue Zhou、Hengkai Pan 与 Yann LeCun、Lerrel Pinto(后两位同属 Meta FAIR)提出,2024 年 11 月发布,发表于 ICML 2025。很多世界模型要重建像素,或和任务奖励绑定。DINO-WM 用预训练且冻结的 DINOv2 提取图块(patch)特征,只训练一个预测器:给定当前特征和动作,预测下一步特征,不重建图像。训练只用离线收集的轨迹,不需要专家演示、奖励模型或逆动力学模型。测试时给一张目标图像,用模型预测控制(MPC)搜索动作序列,让预测出的未来特征尽量接近目标特征,实现零样本规划。它代表了在预训练表征的隐空间里做世界模型的路线,与 JEPA、V-JEPA 2 思路相近。
例子在 Push-T 任务中给出目标摆放图像,DINO-WM 在特征空间里推演不同推动动作,选出让 T 形块最接近目标位姿的序列;同一方法还用于迷宫导航、绳子和颗粒物操作等环境。
- 也叫
- DINO World Model
- 相关
- 世界模型、隐空间世界模型、DINOv2、模型预测控制、联合嵌入预测架构、V-JEPA 2
- 来源
- DINO-WM (arXiv:2411.04983)
DINO-WM 项目主页
Gaoyue Zhou 个人主页(标注 ICML 2025) - 信息截至
- 2025