COCO / LVIS 数据集
COCO / LVIS (Common Objects in Context / Large Vocabulary Instance Segmentation)进阶最常用的检测与分割基准,LVIS 在 COCO 图片上扩展到上千个长尾类别。
COCO 由微软等机构 2014 年发布,约 33 万张日常场景图片、150 万个物体实例,检测和实例分割用 80 个类别,另有图像描述、人体关键点等标注,是检测、分割模型最常用的训练和评测集,mAP(平均精度均值)通常在它上面报告。LVIS 由 Facebook AI Research 的 Gupta、Dollár、Girshick 在 CVPR 2019 提出,复用 COCO 图片,重新标注了 1203 个类别、约 200 万个实例掩码,类别呈长尾分布(少数类很常见,大量类样本很少),专门考察稀有类别识别。开放词汇检测(按任意文字描述找物体)常用 LVIS 稀有类衡量零样本能力。机器人感知用的检测、分割模型大多在这两个数据集上预训练或评测。
例子YOLO 系列新版本发布时通常报告 COCO val2017 上的 mAP;YOLO-World、Grounding DINO 这类开放词汇检测器则报告在 LVIS 上的零样本 AP。
- 也叫
- MS COCO、Microsoft COCO、LVIS v1.0
- 相关
- 目标检测、实例分割、开放词汇检测、平均精度均值、YOLO、Grounding DINO
- 来源
- Microsoft COCO: Common Objects in Context (arXiv 1405.0312)
LVIS: A Dataset for Large Vocabulary Instance Segmentation (arXiv 1908.03195)
COCO 官网数据集介绍