NaVid
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation进阶北大与智源等 2024 年提出的视频大模型导航方法,只看单目视频决定下一步。
NaVid 由北京大学王鹤团队联合智源研究院、阿德莱德大学、银河通用等于 2024 年 2 月提出,发表于 RSS 2024,做的是视觉语言导航(按一句话指令走到目的地)。以往方法多依赖地图、里程计或深度图,NaVid 只用单目 RGB 视频:当前帧压成 64 个 token、每个历史帧压成 4 个,送进基于 Vicuna-7B 的视频大模型,直接用文字输出下一步,如前进多少厘米、转多少度或停止。它在 R2R-CE 上只用 RGB 达到 37.4% 成功率,并能迁移到真机。后续的 Uni-NaVid(RSS 2025)把指令导航、找物体、具身问答、跟人四类任务合进一个模型,用 360 万条样本训练。
例子在 4 个真实室内场景、共 200 条指令的测试中,装在 Turtlebot4 小车上的 NaVid 对简单指令成功率约 66%,对多步复合指令约 48%。
- 也叫
- Uni-NaVid
- 相关
- 视觉语言导航、R2R / VLN-CE 视觉语言导航基准、视觉语言模型、NaVILA、银河通用 NavFoM、仿真到现实迁移
- 来源
- NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation (arXiv 2402.15852)
NaVid 项目页
Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks (arXiv 2412.06224) - 信息截至
- 2025-02