具身智能新手名词表English

LLaVA(视觉指令微调架构)

LLaVA (Large Language and Vision Assistant, Visual Instruction Tuning)LLaVA常用

2023 年的开源多模态模型:视觉编码器经投影层接入大语言模型,再用指令数据微调。

LLaVA 由威斯康星大学麦迪逊分校、微软研究院和哥伦比亚大学的 Haotian Liu、Chunyuan Li 等人于 2023 年 4 月提出,论文《Visual Instruction Tuning》是 NeurIPS 2023 口头报告。结构很简单:CLIP ViT-L/14 视觉编码器提取图像特征,经一个投影层(把视觉特征变换到语言模型的词向量空间)送进 Vicuna 大语言模型。训练分两阶段:先冻结语言模型,只训投影层做特征对齐;再端到端微调。关键在数据:用纯文本 GPT-4 生成 15.8 万条图文指令数据,含对话、细节描述和复杂推理三类。2023 年 10 月的 LLaVA-1.5 把投影层换成两层 MLP,只用公开数据、单台 8 卡 A100 约一天训完,在 11 个基准上达到当时最佳。「视觉编码器 + 投影层 + 大语言模型 + 指令微调」成为之后多数开源 VLM 的通用做法,很多 VLA 也是在这类 VLM 上加动作输出。

例子生成训练数据时 GPT-4 看不到图,只拿到图片的文字描述和物体框坐标,据此写出关于这张图的多轮问答和推理题;再把这些问答配上原图,用来训练 LLaVA。

也叫
Large Language and Vision Assistant、视觉指令微调、LLaVA-1.5
相关
视觉语言模型、多模态大语言模型、指令微调、投影层、CLIP、Prismatic VLM
来源
Visual Instruction Tuning (arXiv 2304.08485)
Improved Baselines with Visual Instruction Tuning (LLaVA-1.5, arXiv 2310.03744)
LLaVA 项目主页
信息截至
2023-10

在完整名词表里查看 →