具身智能新手名词表English

Mamba

Mamba (Selective State Space Model)进阶

用随输入变化的状态空间模型替代注意力、计算量随序列长度线性增长的序列模型。

Mamba 由卡内基梅隆大学的 Albert Gu 和普林斯顿大学的 Tri Dao 于 2023 年 12 月提出。Transformer 的自注意力计算量随序列长度平方增长,长序列代价很高;状态空间模型(SSM)像循环网络一样用固定大小的隐状态逐步吸收输入,计算量线性增长,但早期 SSM 参数固定,不能按内容决定记住还是忘掉什么。Mamba 让这些参数随当前输入变化(即「选择性」),配合面向 GPU 的并行扫描算法,整个架构不用注意力,也不用单独的 MLP 块。论文报告其推理吞吐量约为 Transformer 的 5 倍,Mamba-3B 的效果与两倍参数的 Transformer 相当;2024 年两人又推出快 2–8 倍的 Mamba-2。机器人领域有 RoboMamba 等工作用它降低 VLA 的推理延迟。

例子RoboMamba 以 Mamba 语言模型为骨干构建 VLA,只微调约 0.1% 的参数就学会操作技能,论文报告其推理速度是当时已有 VLA 模型的 3 倍。

也叫
选择性状态空间模型、Selective State Space Model、Selective SSM、Mamba-2
相关
状态空间模型、Transformer、循环神经网络、RoboMamba、推理延迟、上下文长度
来源
Mamba: Linear-Time Sequence Modeling with Selective State Spaces (arXiv:2312.00752)
Transformers are SSMs (Mamba-2, arXiv:2405.21060)
RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation (arXiv:2406.04339)
信息截至
2024-05

在完整名词表里查看 →