具身智能新手名词表English

视觉提示(Set-of-Mark 标记提示)

Visual Prompting (Set-of-Mark / Mark-based Visual Prompting)SoM进阶

在图片上画编号、框、点等标记,让视觉语言模型用「选标号」的方式指出位置。

视觉提示指不改模型参数,直接在输入图像上加标记来引导视觉语言模型(VLM)。代表方法是微软研究院 2023 年 10 月提出的 Set-of-Mark(SoM):先用 SAM、SEEM 等分割模型把图片切成若干区域,在每块上叠加数字、掩码或框,再向 GPT-4V 这类模型提问。VLM 直接输出精确像素坐标很难,但回答「3 号区域」容易得多;SoM 在零样本下的 RefCOCOg 指代分割上超过了专门微调的模型。机器人里常用它把「抓哪里、往哪放」变成选择题:MOKA(2024,伯克利)在图上标出候选关键点和路点,让 VLM 挑出抓取点和运动路线,再换算成机械臂动作;PIVOT 则在图上画出一批候选动作,让 VLM 挑选并迭代收窄。

例子一张桌面照片先用 SAM 分割出每个物体并标上 1、2、3……,再问 GPT-4V「哪个是红色杯子」,模型回答「2」,程序就能取出 2 号区域的精确掩码,交给抓取模块使用。

也叫
标记提示、SoM 提示、Set-of-Mark Prompting、Mark-based Visual Prompting
相关
视觉语言模型、视觉定位(Grounding)、分割一切模型、MOKA(标记式视觉提示操作)、PIVOT(迭代视觉提示)、提示词 / 提示工程
来源
Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V (arXiv:2310.11441)
MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting (arXiv:2403.03174)

在完整名词表里查看 →