具身智能新手名词表English

掩码

Mask常用

与图像同尺寸的逐像素标记图,标出哪些像素属于某个物体。

掩码是一张和原图大小相同的图,每个像素取 0 或 1(或类别编号),用来标出哪些像素属于目标。分割模型的输出本质上就是掩码:语义分割每类一张,实例分割每个物体一张。它比检测框精确,框里常混着背景,掩码则贴着物体轮廓。存储时,COCO 数据集对单个物体用多边形顶点,对成群物体用游程编码(RLE)压缩。Meta 的 SAM 在 1100 万张图上标注了超过 10 亿个掩码,点一下或框一下就能得到任意物体的掩码。机器人里常用掩码从深度图或点云中只取出目标物体再算抓取。Transformer 里的注意力掩码是另一个概念,别混淆。

例子指令「抓红色杯子」:先用 Grounded-SAM 得到杯子的掩码,叠到对齐后的深度图上,只把杯子对应的像素反投影成点云,再交给抓取检测网络。

也叫
分割掩码、Segmentation Mask、二值掩码
相关
实例分割、语义分割、分割一切模型、Grounded-SAM、注意力掩码、点云分割
来源
Segment Anything (arXiv:2304.02643)
COCO Data Format(segmentation: polygon / RLE)

在完整名词表里查看 →