具身智能新手名词表English

视觉语言模型

Vision-Language ModelVLM入门必知

能同时看图和读文字、再用文字作答的模型,是多数 VLA 的底座。

视觉语言模型接收图像和文本、输出文本,能描述图片、回答关于图片的问题、指出物体位置。常见结构有三部分:视觉编码器把图像变成特征,投影层把特征对齐到语言模型的输入空间,语言模型负责理解和生成文字。2023 年的 LLaVA 就是 CLIP 编码器加投影层加 Vicuna 语言模型;谷歌 2024 年开源的 PaliGemma 由 SigLIP 编码器和 Gemma-2B 组成,约 30 亿参数。VLM 从互联网图文里学到的物体、常识和空间知识正是机器人缺的,所以大多数 VLA 从 VLM 出发:RT-2 在 PaLI-X、PaLM-E 上加入机器人数据联合微调,π0 以 PaliGemma 为底座。VLM 也常单独用作分层架构的高层规划器。

例子给 VLM 一张厨房照片问「水槽左边有什么」,它用文字回答;把输出换成动作 token、再用机器人数据训练,就得到 RT-2 这类 VLA。

也叫
视觉语言大模型、视觉-语言模型、图文大模型
相关
视觉-语言-动作模型、视觉编码器、投影层、大语言模型、PaliGemma、多模态大语言模型
来源
Vision Language Models Explained (Hugging Face blog)
PaliGemma: A versatile 3B VLM for transfer (arXiv:2407.07726)
RT-2: Vision-Language-Action Models (project page)
信息截至
2024-07

在完整名词表里查看 →