字节 GR-1
GR-1: Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation (ByteDance)GR-1进阶字节跳动 2023 年底的操作模型,先在视频上学预测未来画面,再学出动作。
GR-1 由字节跳动研究团队(ByteDance Research)2023 年 12 月发布,发表于 ICLR 2024。它是一个 GPT 式 Transformer:输入语言指令、一段历史图像和机器人状态,同时输出未来画面和机器人动作。训练分两步:先在大规模视频上做视频预测预训练,只学「下一帧会是什么样」,不需要动作标签;再用机器人数据微调,让模型边预测画面边输出动作。作者的思路是,预测视频能让模型学到物体怎么被推动、怎么变化,这些知识对操作有用。在 CALVIN 基准上,它把成功率从 88.9% 提到 94.9%,零样本泛化到没见过场景的成功率从 53.3% 提到 85.4%。它是字节 GR 系列的第一代,后续有 GR-2、GR-3。注意别和傅利叶的人形机器人 GR-1 混淆。
例子在 CALVIN 仿真厨房桌面里,GR-1 按语言指令连续完成「打开抽屉」「把蓝色方块推到左边」「打开灯泡」等一串子任务。
- 也叫
- 字节跳动 GR-1
- 相关
- 视频预测模型、字节 GR-2、字节 GR-3、CALVIN、语言条件策略、预训练
- 来源
- Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation (arXiv 2312.13139)
GR-1 项目页
bytedance/GR-1 GitHub 仓库(ICLR 2024) - 信息截至
- 2024-01