具身智能新手名词表English

3D视觉定位

3D Visual Grounding进阶

根据一句话的描述,在三维场景里找到它指的那个物体。

3D 视觉定位把 2D 视觉定位(用文字在图片里框出目标)搬到三维场景:输入场景的点云或多视角图像,加一句描述,如「靠窗那把椅子旁边的垃圾桶」,输出目标物体的三维包围框。中文「视觉定位」也常指估计相机自身位置,这里指的是 grounding。难点是场景里常有多个同类物体,必须理解「左边」「最大的」「挨着门」这类空间关系才能区分。ScanRefer 和 ReferIt3D(均发表于 ECCV 2020)在 ScanNet 室内扫描上建立了基准,前者含约 5.2 万条描述、1.1 万个物体,后者含 Nr3D 自然描述和 Sr3D 空间关系描述两套数据。对机器人来说,它是把语言指令落到具体物体上的关键一步。

例子用户说「把书桌上最右边那个蓝色杯子给我」,机器人先在重建好的房间点云里做 3D 视觉定位,得到那只杯子的三维框,再规划抓取。

也叫
3D Grounding、3D 视觉接地、3D 指代定位、3D Referring Expression Grounding
相关
视觉定位(Grounding)、ScanNet 数据集、3D目标检测、3D场景图、开放词汇检测、语言接地
来源
ScanRefer: 3D Object Localization in RGB-D Scans using Natural Language (ECCV 2020)
ReferIt3D: Neural Listeners for Fine-Grained 3D Object Identification in Real-World Scenes (ECCV 2020)

在完整名词表里查看 →