Grounding DINO
Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection常用输入图片和一段文字,就能框出文字所指物体的开放词汇目标检测模型。
Grounding DINO 是 IDEA 研究院联合清华等团队 2023 年 3 月发布的开放集目标检测模型,论文后被 ECCV 2024 接收。传统检测器只认训练时固定的那几十类;它把 Transformer 检测器 DINO 和文本编码器结合,在图像和文本特征之间做多层融合,用户输入类别名或一句描述(如「红色杯子」),就输出对应的检测框和匹配的词。论文报告在不用 COCO 训练数据时,COCO 零样本检测达到 52.5 AP。代码以 Apache 2.0 开源,已接入 Hugging Face Transformers。它常和分割模型 SAM 串成 Grounded-SAM:先按文字框出物体,再抠出掩码,是机器人「按指令找东西」的常用前端。后续的 Grounding DINO 1.5/1.6 只通过 API 提供。
例子用户说「把香蕉放进碗里」,系统用 Grounding DINO 以「banana. bowl.」为提示框出两个物体,再用 SAM 得到掩码,结合深度图算出抓取点和放置点。
- 也叫
- GroundingDINO
- 相关
- 开放词汇检测、Grounded-SAM、分割一切模型、OWL-ViT / OWLv2、YOLO-World、DINO-X(开放世界检测)
- 来源
- Grounding DINO (arXiv:2303.05499)
IDEA-Research/GroundingDINO (GitHub)
IDEA-Research/Grounding-DINO-1.5-API (GitHub) - 信息截至
- 2024-07