DINO-X(开放世界检测)
DINO-X: A Unified Vision Model for Open-World Object Detection and Understanding (IDEA)进阶IDEA 研究院的开放世界检测模型,可按文字、示例或无提示框出物体。
DINO-X 是粤港澳大湾区数字经济研究院(IDEA)2024 年 11 月发布的以物体为中心的视觉模型,架构沿用 Grounding DINO 1.5 的 Transformer 编码器-解码器。它支持文字提示、视觉提示(给示例框)和定制提示,其中「通用物体提示」让模型不给提示也能把图中物体都框出来。训练用了团队整理的 1 亿多条定位样本 Grounding-100M。检测头之外还挂了分割、关键点和物体描述等头,可同时输出框、掩码、姿态和文字描述。论文报告 DINO-X Pro 在 COCO 零样本检测上达到 56.0 AP;另有面向边缘设备的 DINO-X Edge。它主要通过 API 提供,机器人里可用它按一句指令找到目标,再交给分割和抓取模块。
例子把一张桌面照片和提示词「cup」发给 DINO-X API,返回每个杯子的检测框和置信度;再把框交给 SAM 2 得到像素级掩码,就能配合深度图算出杯子位置去抓取。
- 也叫
- DINO-X、DINO-X Pro、DINO-X Edge
- 相关
- Grounding DINO、开放词汇检测、DETR、目标检测、分割一切模型、Grounded-SAM
- 来源
- arXiv 2411.14347: DINO-X: A Unified Vision Model for Open-World Object Detection and Understanding
IDEA-Research/DINO-X-API (GitHub) - 信息截至
- 2025-07