VLMaps
Visual Language Maps for Robot Navigation进阶把视觉语言特征写进三维地图,让机器人按「椅子右边三米」这类话导航。
VLMaps 由弗莱堡大学、Google Research 和纽伦堡工业大学的 Chenguang Huang、Oier Mees、Andy Zeng、Wolfram Burgard 提出,2022 年 10 月上线 arXiv,发表于 ICRA 2023。它让机器人边走边用 RGB-D 视频建图:用开放词汇分割模型 LSeg 给每个像素算一个视觉语言特征,借助深度和位姿投到三维表面,再压成俯视网格地图。查询时把「沙发」「冰箱」等词用文本编码器编码,和地图特征比相似度,就能定位任意物体,属于开放词汇语义地图。复杂指令先交给大语言模型(GPT-3 系列)写成调用地图接口的代码,因此能处理「在两个物体之间」「往右三米」等空间关系。同一张地图还能按不同机器人生成各自的障碍物地图。它是把基础模型接进导航地图的早期代表工作。
例子对机器人说「移动到椅子右边三米的地方」,语言模型把指令转成代码,先在地图里查出椅子的位置,再算出右侧三米的目标点让机器人前往。
- 也叫
- 视觉语言地图、Visual Language Maps
- 相关
- 语义地图、视觉语言导航、开放词汇、代码即策略、CLIP、VLFM(视觉语言前沿地图)
- 来源
- Visual Language Maps for Robot Navigation (arXiv 2210.05714)
VLMaps 项目主页
vlmaps/vlmaps (GitHub) - 信息截至
- 2023-03