语义分割
Semantic Segmentation常用给图像里每个像素标上类别,如「桌子」「杯子」「地面」。
语义分割是计算机视觉的基础任务:判断图像中每个像素属于哪一类,输出一张和原图一样大的类别图。它只管「是什么类」,不区分同类的不同个体,两只杯子会被标成同一片「杯子」;要把个体分开用实例分割,两者合起来叫全景分割。2015 年 Long 等人提出全卷积网络(FCN),让网络端到端直接做逐像素预测,之后成为主流做法。机器人用它找出可抓取物体所在的区域、可通行的地面,或把类别投到三维点云上建语义地图。早期模型只认训练集里的固定类别,现在常用开放词汇分割,按文字描述去分任意类别。
例子输入一张厨房照片,桌面像素标成「桌子」,两只杯子都标成「杯子」,其余为「背景」;机器人据此取出「杯子」区域对应的点云来规划抓取。
- 也叫
- 像素级分类、Semantic Seg
- 相关
- 实例分割、全景分割、开放词汇分割、掩码、语义地图、分割一切模型
- 来源
- Fully Convolutional Networks for Semantic Segmentation (Long, Shelhamer, Darrell, CVPR 2015)
Wikipedia: Image segmentation