具身智能新手名词表English

语义分割

Semantic Segmentation常用

给图像里每个像素标上类别,如「桌子」「杯子」「地面」。

语义分割是计算机视觉的基础任务:判断图像中每个像素属于哪一类,输出一张和原图一样大的类别图。它只管「是什么类」,不区分同类的不同个体,两只杯子会被标成同一片「杯子」;要把个体分开用实例分割,两者合起来叫全景分割。2015 年 Long 等人提出全卷积网络(FCN),让网络端到端直接做逐像素预测,之后成为主流做法。机器人用它找出可抓取物体所在的区域、可通行的地面,或把类别投到三维点云上建语义地图。早期模型只认训练集里的固定类别,现在常用开放词汇分割,按文字描述去分任意类别。

例子输入一张厨房照片,桌面像素标成「桌子」,两只杯子都标成「杯子」,其余为「背景」;机器人据此取出「杯子」区域对应的点云来规划抓取。

也叫
像素级分类、Semantic Seg
相关
实例分割、全景分割、开放词汇分割、掩码、语义地图、分割一切模型
来源
Fully Convolutional Networks for Semantic Segmentation (Long, Shelhamer, Darrell, CVPR 2015)
Wikipedia: Image segmentation

在完整名词表里查看 →