MemoryVLA
MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation进阶给 VLA 加上工作记忆和记忆库,让机器人记得之前看到和做过什么。
MemoryVLA 是清华大学黄高团队与原力灵机(Dexmal)、旷视等机构合作的工作,2025 年 8 月发布,发表于 ICLR 2026。多数 VLA 只看当前画面决定动作,但很多操作任务光看当前一帧不够:例如按下按钮前后画面可能几乎一样,不记得历史就分不清按没按过。MemoryVLA 借用认知科学中工作记忆和情景记忆的概念:用 7B 视觉语言模型把观测编码成感知 token 和认知 token,作为工作记忆;另设记忆库保存过去的低层细节和高层语义,按需检索并与当前信息融合;最后由扩散动作专家输出一段动作。论文报告在 SimplerEnv-Bridge 上成功率 71.9%,LIBERO 上 96.5%,真机任务 84.0%,长时序任务提升明显。
例子例如「依次按下三个按钮」,每次按完画面变化很小,靠记忆库记住已经按过哪个,才能避免重复按或漏按。
- 相关
- 记忆增强 VLA、具身记忆、视觉-语言-动作模型、长程任务、扩散动作头、原力灵机
- 来源
- arXiv 2508.19236: MemoryVLA
MemoryVLA 项目主页 - 信息截至
- 2026-01