具身智能新手名词表English

Prismatic VLM

Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models进阶

斯坦福与丰田研究院系统比较 VLM 设计的研究和开源模型,OpenVLA 的底座。

Prismatic VLM 出自斯坦福大学和丰田研究院(TRI)的论文,Siddharth Karamcheti 等人发表于 ICML 2024。作者搭了统一的训练与评测框架(12 个基准,覆盖视觉问答、物体定位和挑战集),逐项比较视觉语言模型的设计选择:用哪个视觉编码器、要不要先单独做对齐预训练、语言模型用基座版还是指令微调版等。主要结论:跳过单独的对齐阶段、只做单阶段训练,效果不差还省 20%–25% 算力;把 DINOv2 和 SigLIP 的特征拼起来,定位类任务提升明显;指令微调版语言模型没有显著优势。据此训出的 7B–13B 模型超过同期的 InstructBLIP 和 LLaVA v1.5,代码和几十个检查点都已开源。它和具身智能的关系在于 OpenVLA 直接以 Prismatic-7B 为底座,OpenVLA 论文认为这种融合视觉编码器有助于空间推理。

例子OpenVLA 的底座 Prismatic-7B 由约 6 亿参数的 DINOv2 + SigLIP 融合视觉编码器、2 层 MLP 投影层和 Llama 2 7B 语言模型组成。

也叫
Prismatic VLMs、Prismatic-7B
相关
OpenVLA、视觉语言模型、DINOv2、SigLIP、投影层、Llama
来源
Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models (arXiv 2402.07865)
TRI-ML/prismatic-vlms (GitHub)
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)
信息截至
2024-07

在完整名词表里查看 →