导航世界模型
Navigation World Models (Meta)NWM进阶Meta 2024 年底提出的导航用视频世界模型,按动作想象走过去会看到什么。
导航世界模型由 Meta FAIR 的 Amir Bar、Yann LeCun 等与纽约大学、伯克利合作提出,2024 年 12 月上 arXiv,获 CVPR 2025 最佳论文荣誉提名。它是一个可控的视频生成模型:给定过去的画面和一段导航动作(往哪走、转多少),预测接下来会看到的画面。模型是 10 亿参数的条件扩散 Transformer(CDiT),用人类和机器人的第一人称视频训练。有了它,机器人可以先在模型里模拟多条路线,挑能到达目标的那条;也能给 NoMaD 等现成策略采样的轨迹打分排序;还能只凭一张照片想象在陌生环境里行走。作者也指出,在陌生环境里生成久了,画面会逐渐偏向训练数据。
例子给定起点照片和一张目标照片,NWM 对一批候选动作序列逐条生成沿途画面,选终点画面最接近目标照片的那条去执行。
- 相关
- 世界模型、视频预测模型、扩散 Transformer、NoMaD、图像目标导航、Meta FAIR
- 来源
- Navigation World Models (arXiv 2412.03572)
Navigation World Models 项目页 - 信息截至
- 2025-06