RoboFlamingo
RoboFlamingo (Vision-Language Foundation Models as Effective Robot Imitators)进阶把开源 OpenFlamingo 视觉语言模型微调成机器人操作策略的早期工作
RoboFlamingo 由字节跳动研究院联合清华大学、上海交通大学、新加坡国立大学在 2023 年 11 月发布,是较早把开源视觉语言模型(VLM)直接改造成操作策略的工作。它以 OpenFlamingo 为骨干,每一步负责理解当前画面和语言指令,再接一个显式策略头(如 LSTM)汇总历史信息、输出机械臂动作,只在带语言标注的演示数据上做模仿学习微调。这种「理解」和「决策」分开的设计让它在一台 8 卡 GPU 服务器上就能训练。在 CALVIN 长程任务基准上,它平均能连续完成 4.09 个任务,明显高于此前方法;但论文只在仿真中验证。同一批作者后来把这条思路扩展成系统研究 RoboVLMs。
例子在 CALVIN 中连续给 5 条指令(如「打开抽屉」「把蓝色方块往左推」),RoboFlamingo 平均能连续做完约 4 条。
- 相关
- 视觉语言模型、视觉-语言-动作模型、CALVIN、模仿学习、RoboVLMs、Flamingo
- 来源
- arXiv 2311.01378: Vision-Language Foundation Models as Effective Robot Imitators
RoboFlamingo 项目主页
GitHub: RoboFlamingo - 信息截至
- 2024-02