具身智能新手名词表English

R2R / VLN-CE 视觉语言导航基准

Room-to-Room / VLN in Continuous EnvironmentsR2R / VLN-CE常用

视觉语言导航最常用的基准:照着人写的路线说明在陌生房屋里走到终点。

R2R(Room-to-Room)由澳大利亚国立大学、阿德莱德大学等团队于 2018 年随 Matterport3D 模拟器发布,基于 90 栋真实建筑扫描,含约 2.2 万条人写的路线指令,智能体只能在预建导航图的节点间跳转。2020 年俄勒冈州立大学、佐治亚理工与 Facebook AI 提出 VLN-CE,把 R2R 搬进 Habitat 的连续环境,智能体要用「前进 0.25 米、左转 15 度、停止」这类底层动作行走,更接近真实机器人,成绩也明显下降。谷歌 2020 年的 RxR 含 12.6 万条英语、印地语、泰卢固语指令。常用指标有成功率、SPL(路径长度加权成功率)和 nDTW。

例子VLN-CE 官方的跨模态注意力基线在 R2R 连续环境测试集上成功率 0.28、SPL 0.25,可见连续环境比导航图版本难得多。

也叫
R2R、VLN-CE、RxR、R2R-CE、RxR-CE、Room-to-Room
相关
视觉语言导航、Habitat、Matterport3D 数据集、路径长度加权成功率、归一化动态时间规整、NaVILA
来源
Room-to-Room (R2R) 官网
VLN-CE 项目页
jacobkrantz/VLN-CE GitHub(含 RxR-Habitat)

在完整名词表里查看 →