具身智能新手名词表English

指代表达分割

Referring Expression SegmentationRES进阶

根据一句描述某个物体的话,在图中把那个物体精确抠出来。

指代表达分割的输入是一张图和一句自然语言描述(如「右边长椅上坐着的两个人」),输出描述所指物体的像素级掩码。它比开放词汇分割更细:后者按类别名分出所有同类物体,指代分割则要依据颜色、位置、相互关系等描述挑出特定的那一个。2016 年 Hu 等人提出了较早的端到端方法:用 LSTM 编码句子,与卷积网络的特征图融合后逐像素预测。常用基准有 RefCOCO、RefCOCO+ 和 G-Ref。如今多由多模态大模型或文本定位模型配合 SAM 类分割模型完成。机器人听到「把左边那个红杯子递给我」时,就要先靠它找出目标的像素区域,再结合深度得到 3D 位置去抓。

例子指令为「拿桌上最左边的蓝色积木」,模型在腕部相机图像中输出那一块积木的掩码。

也叫
指代分割、指代图像分割、Referring Image Segmentation
相关
视觉定位(Grounding)、开放词汇分割、实例分割、掩码、Grounded-SAM、语言接地
来源
Segmentation from Natural Language Expressions (arXiv 1603.06180)

在完整名词表里查看 →