VIMA
VIMA: General Robot Manipulation with Multimodal Prompts进阶用图文混排的「多模态提示」统一描述各种操作任务的 Transformer 机器人智能体
斯坦福、英伟达、加州理工等机构的 Yunfan Jiang、Linxi Fan、Yuke Zhu、李飞飞等人 2022 年 10 月发布,发表于 ICML 2023。机器人任务的下达方式五花八门:给一段演示让它照做、用语言描述、给一张目标图。VIMA 把它们统一成「文字和图片穿插」的多模态提示,比如「把 [某物体的图] 放进 [某容器的图]」,由一个 Transformer 读入提示并自回归地输出动作。作者还做了仿真基准 VIMA-Bench:17 类任务模板、可程序化生成成千上万个桌面任务、60 多万条专家轨迹,以及四级逐步变难的泛化评测。论文称在最难的零样本设定下成功率比其他设计最高高 2.9 倍。
例子给 VIMA 的提示是一句话里夹着两张小图:「把 [红色积木图] 放到 [绿色盘子图] 上」,它就在仿真桌面上找到对应物体完成抓放;换成先给一段演示图再说「照这样做」也用同一个模型。
- 相关
- VIMA-Bench、语言条件策略、组合泛化、桌面操作、模仿学习、Transformer
- 来源
- VIMA (arXiv 2210.03094)
VIMA project page - 信息截至
- 2023-05