具身智能新手名词表English

OpenVLA

OpenVLA: An Open-Source Vision-Language-Action Model入门必知

斯坦福、伯克利等 2024 年开源的 70 亿参数视觉-语言-动作模型。

OpenVLA 由斯坦福、UC Berkeley、丰田研究院、谷歌 DeepMind、Physical Intelligence 和 MIT 的研究者于 2024 年 6 月发布,发表于 CoRL 2024。它以 Prismatic 视觉语言模型为底座:视觉编码器融合 SigLIP 和 DINOv2 两种特征,语言模型是 Llama 2 7B,总参数约 70 亿。动作沿用 RT-2 的做法,把每个动作维度离散成 256 个区间,当作 token 让语言模型逐个预测。它在 Open X-Embodiment 数据集的 97 万条机器人轨迹上训练,在 29 个任务上比 550 亿参数的闭源 RT-2-X 绝对成功率高 16.5%。更重要的是代码和权重完全开源,可以用 LoRA(低秩适配,只训练少量新增参数)在消费级显卡上微调,因而成为很多后续 VLA 研究的起点和对比基线,如 OpenVLA-OFT。

例子把 OpenVLA 适配到新的机械臂和任务时,用 LoRA 只训练约 1.4% 的参数,就能达到与全参数微调相当的效果。

也叫
OpenVLA-7B
相关
视觉-语言-动作模型、RT-2、Open X-Embodiment 数据集、Prismatic VLM、OpenVLA-OFT、低秩适配
来源
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)
OpenVLA 项目主页
信息截至
2024-09

在完整名词表里查看 →