RoboMamba
RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation进阶用 Mamba 状态空间模型替代 Transformer 做语言骨干的高效 VLA
RoboMamba 由北京大学联合智平方、北京智源人工智能研究院在 2024 年 6 月发布,NeurIPS 2024 录用。当时的 VLA 多以 Transformer 大语言模型为骨干,推理慢、算力贵。RoboMamba 改用 Mamba(一种选择性状态空间模型,计算量随序列长度线性增长)作语言模型,接上视觉编码器,先做对齐预训练和通用、机器人指令数据的协同训练,让它具备推理能力;再冻结整个模型,只加一个很小的策略头(约占模型参数 0.1%)预测末端执行器的 SE(3) 位姿,即位置和朝向。论文报告其推理速度约为已有 VLA 的 3 倍,在仿真和真机上的位姿预测也有竞争力。
例子RoboMamba 既能回答「桌上哪个东西能用来盛水」这类推理问题,也能在收到操作指令后输出夹爪应到达的位置和朝向。
- 相关
- Mamba、状态空间模型、视觉-语言-动作模型、推理延迟、末端位姿、参数高效微调
- 来源
- arXiv 2406.04339: RoboMamba
RoboMamba 项目主页 - 信息截至
- 2024-12