MOKA(标记式视觉提示操作)
MOKA: Open-World Robotic Manipulation through Mark-Based Visual PromptingMOKA进阶在图上画标记让 GPT-4V 选关键点,再把关键点转成机械臂动作的免训练方法
UC Berkeley 的 Fangchen Liu、Kuan Fang、Pieter Abbeel、Sergey Levine 在 2024 年 3 月发布,发表于 RSS 2024。视觉语言模型懂常识,却不会直接输出机器人动作。MOKA 把「该怎么操作」改写成看图答题:在相机图像上叠加候选点、网格、文字说明等标记(即视觉提示),让 GPT-4V 分层地选出抓取点、工具与物体接触的作用点、目标点以及中间路点,再把这些关键点换算成机械臂的运动。它不需要为新任务收集机器人数据,能处理用工具、柔性物体操作和物体重排等桌面任务;执行中收集到的成功经验还能作为上下文示例,或蒸馏成一个策略网络。它是用视觉提示把 VLM 接到机器人上的代表工作。
例子指令是「用刷子把碎屑扫到一边」时,GPT-4V 在带标记的图上选出刷柄的抓取点、刷毛接触桌面的作用点和扫动方向上的路点,机器人按这些点依次执行。
- 相关
- 视觉提示(Set-of-Mark 标记提示)、可供性、视觉语言模型、零样本、工具使用、PIVOT(迭代视觉提示)
- 来源
- MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting (arXiv 2403.03174)
MOKA project page - 信息截至
- 2024-09