视觉定位(Grounding)
Visual Grounding常用根据一句话描述,在图像里找出它所指物体的位置。
视觉定位(visual grounding)把语言和图像区域对应起来:输入图片和一段文字,输出所指物体的框、掩码或点。给短语找区域叫短语定位;给「左边那只红杯子」这类只指向唯一目标的描述叫指代表达理解(REC),常用 RefCOCO 系列数据集评测。它比普通检测多了理解属性和空间关系的要求。2023 年 IDEA 研究院的 Grounding DINO 能按任意文字找物体,如今多数视觉语言模型也能直接输出框或点坐标。机器人按指令抓东西,第一步往往就是 grounding。注意中文「视觉定位」也常指机器人用相机确定自身位置(visual localization),两者不是一回事。
例子指令是「把左边那只红色杯子递给我」,模型先在相机图像里框出这一只杯子(旁边的蓝杯子不算),再把框内的深度点投到三维空间,交给抓取模块。
- 也叫
- 短语定位、指代表达理解、REC、Referring Expression Comprehension、Phrase Grounding
- 相关
- 指代表达分割、3D视觉定位、Grounding DINO、开放词汇检测、指向(点预测)、视觉语言模型
- 来源
- Modeling Context in Referring Expressions (RefCOCO / RefCOCO+ / RefCOCOg, ECCV 2016)
Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection