具身智能新手名词表English

VLA-Adapter

VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model进阶

用 0.5B 小模型加轻量策略模块、不做机器人预训练也能打到顶尖水平的 VLA。

VLA-Adapter 由北京邮电大学、西湖大学、浙江大学、港科大(广州)和 OpenHelix 团队等 2025 年 9 月发布,已开源代码和权重。常见 VLA 依赖大参数视觉语言模型(VLM)并在大量机器人数据上预训练,成本很高。作者系统比较了 VLM 里哪些层、哪些特征最适合作为动作生成的条件,据此设计了一个约 9700 万参数的策略模块:用 Bridge Attention 把 VLM 各层的原始视觉语言特征和一组可学习查询(ActionQuery)的特征注入动作空间,注入多少由可学习参数控制。骨干只用 Qwen2.5-0.5B,不做机器人数据预训练,LIBERO 平均成功率 97.3%(Pro 版 98.5%),CALVIN ABC→D 平均完成长度 4.50(Pro 版)。它大幅降低了训练和部署门槛,后续 VLA-RFT 等工作以它为基座。

例子论文报告在单张消费级显卡上约 8 小时即可训练出可用模型;推理吞吐 219.2 Hz,同条件下 OpenVLA-OFT 为 71.4 Hz。

也叫
VLA-Adapter-Pro
相关
视觉-语言-动作模型、可学习查询、适配器、OpenVLA-OFT、LIBERO、VLA-RFT
来源
VLA-Adapter (arXiv 2509.09372)
VLA-Adapter 项目主页
OpenHelix-Team/VLA-Adapter (GitHub)
信息截至
2025-09

在完整名词表里查看 →