具身智能新手名词表English

PIVOT(迭代视觉提示)

PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs进阶

在图上画候选动作让 VLM 反复挑选、逐轮收窄,零样本控制机器人

Google DeepMind 主导(Soroush Nasiriany、Fei Xia 等 23 位作者)的工作,2024 年 2 月发布,ICML 2024 论文。VLM 只会输出文字,而机器人需要连续的坐标和动作。PIVOT 把问题改成迭代的视觉问答:先采样一批候选(落点、移动方向或轨迹),在图像上画成带编号的箭头或点;让 VLM 选出最好的几个;再根据选中的候选拟合分布、重新采样,范围越缩越小,几轮后得到最终动作。整个过程不需要任何机器人训练数据,就能做真机导航、桌面操作、仿真指令跟随和图像定位,但作者也承认成功率离实用还远。它是视觉提示路线的代表,思路与 MOKA、Set-of-Mark 相近。

例子让移动机器人去桌边拿可乐:第一轮在画面上画出若干编号箭头表示可走方向,VLM 选中 3 号和 5 号;下一轮只在这两个方向附近重新画箭头再选,直到方向足够精确。

也叫
PIVOT、迭代视觉提示
相关
视觉提示(Set-of-Mark 标记提示)、MOKA(标记式视觉提示操作)、视觉语言模型、零样本、交叉熵方法、RoboPoint
来源
arXiv 2402.07872: PIVOT
ICML 2024 论文页(PMLR v235)
PIVOT 项目主页
信息截至
2024-07

在完整名词表里查看 →