SuSIE
SuSIE: Subgoal Synthesis via Image Editing进阶把图像编辑扩散模型当高层规划器,先画出子目标画面,再让底层策略去达成
UC Berkeley 与斯坦福的 Kevin Black、Sergey Levine、Chelsea Finn 等人 2023 年 10 月发布。方法分两层:高层是开源图像编辑模型 InstructPix2Pix,在人类视频和机器人数据上微调后,输入当前相机画面和语言指令,输出接下来某一时刻「应该是什么样」的子目标图片;低层是只看目标图、不看语言的目标条件策略,负责把机器人从当前画面带到子目标画面。两层交替执行,直到任务完成。这样高层能借用互联网规模图像预训练带来的语义理解去处理新物体、新指令,低层专心做精确控制。它在 CALVIN 基准的零样本设置上取得当时最好成绩,真机实验中也超过了 RT-2-X。它和 UniPi 同属「先生成画面、再推出动作」的路线。
例子指令是「把黄色积木放进抽屉」,SuSIE 先生成一张夹爪已抓住黄色积木的图片当子目标,底层策略到达后,再生成积木落入抽屉的下一张子目标图。
- 也叫
- Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models、基于图像编辑的子目标合成
- 相关
- 目标条件策略、扩散模型、分层架构、CALVIN、UniPi、零样本
- 来源
- Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models (arXiv 2310.10639)
SuSIE project page - 信息截至
- 2023-10