具身智能新手名词表English

目标检测

Object Detection入门必知

在图像里找出物体是什么、在哪里,并用方框标出来的任务。

目标检测是计算机视觉的基础任务:输入一张图,输出其中每个物体的类别、边界框(包住物体的矩形框)和置信度。早期代表是基于手工特征的 Viola-Jones 人脸检测;深度学习后出现 R-CNN 系列两阶段检测器,以及 2015 年提出的 YOLO,它把检测直接当成对边界框和类别概率的回归问题,能实时运行。评估时用交并比(IoU,两框重叠面积占合并面积的比例)判断预测框是否对上,再汇总成 mAP(各类别平均精度的均值)。传统检测器只认识训练时见过的类别,Grounding DINO 这类开放词汇检测器可以用任意文字描述去找物体。机器人里,检测常是模块化流程的第一步:先框出目标,再分割、估位姿、规划抓取。

例子用户说「把红色杯子拿给我」,系统先把「red cup」输入 Grounding DINO 得到边界框,再交给 SAM 抠出掩码,结合深度图算出杯子的三维位置,交给机械臂去抓。

也叫
物体检测、物体识别与定位
相关
检测框(边界框)、开放词汇检测、YOLO、Grounding DINO、交并比、实例分割
来源
Wikipedia: Object detection
You Only Look Once: Unified, Real-Time Object Detection (arXiv 1506.02640)
Grounding DINO (arXiv 2303.05499)

在完整名词表里查看 →