开放词汇检测
Open-Vocabulary Object DetectionOVD常用用文字说出要找什么,检测器就能框出来,不限于训练时的固定类别。
传统检测器只认训练时标过框的固定类别(如 COCO 的 80 类)。开放词汇检测让检测器接受任意文字描述,也能框出训练时没有框标注的新类别。这个设定由 Zareian 等人在 CVPR 2021 的论文中明确提出:用少量基础类别的框标注,加上大量图文对学到的视觉-语言对齐,去检测新类别。之后的 OWL-ViT、Grounding DINO、YOLO-World 都走这条路,Grounding DINO 在没用 COCO 训练的情况下零样本拿到 52.5 AP。对机器人很实用:用户说「把蓝色马克杯拿过来」,可以直接拿这句话去框物体。严格说「开集检测」原指把没见过的物体识别为「未知」,但现在常和开放词汇混用。
例子Grounded-SAM 流水线:先用 Grounding DINO 按文本「香蕉」框出目标,再把框交给 SAM 得到像素级掩码,机器人据此计算抓取点。
- 也叫
- 开放词汇目标检测、开集检测、Open-Set Detection、文本引导检测
- 相关
- 开放词汇、Grounding DINO、OWL-ViT / OWLv2、YOLO-World、Grounded-SAM、目标检测
- 来源
- Open-Vocabulary Object Detection Using Captions (CVPR 2021)
Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection