多模态大语言模型
Multimodal Large Language ModelMLLM常用以大语言模型为核心、能同时理解图像、视频、音频等输入的大模型。
多模态大语言模型指以大语言模型(LLM)为「大脑」、还能接收图像、视频、音频等非文本输入的模型,2023 年 GPT-4V 让这一方向广受关注。Yin 等人的综述把典型结构拆成三块:预训练的模态编码器(如 CLIP、SigLIP 视觉编码器)、预训练的 LLM,以及连接两者的模态接口(MLP 投影层、Q-Former 或插入 LLM 的交叉注意力)。训练通常先做模态对齐预训练,再做指令微调。只处理图像和文字的 MLLM 也常叫视觉语言模型(VLM)。它对具身智能的意义在于带来互联网规模的常识和视觉理解:多数 VLA 就是在 MLLM / VLM 上加动作输出训练出来的,具身推理模型、任务规划器也多由 MLLM 微调而来。
例子LLaVA-1.5 用 CLIP-ViT-L-336px 视觉编码器,通过一个 MLP 投影层接到语言模型上,再用视觉指令数据微调;GPT-4o、Gemini、Qwen2.5-VL 也都属于多模态大语言模型。
- 也叫
- 多模态大模型、Multimodal LLM
- 相关
- 视觉语言模型、大语言模型、原生多模态、投影层、视觉-语言-动作模型、模态对齐
- 来源
- A Survey on Multimodal Large Language Models (arXiv:2306.13549)
Improved Baselines with Visual Instruction Tuning (LLaVA-1.5, arXiv:2310.03744)