Q-Former
Querying Transformer进阶BLIP-2 中用 32 个可学习查询提炼图像信息、再交给大语言模型的小模块。
Q-Former 是 Salesforce 在 2023 年 BLIP-2 论文里提出的连接模块,用来把冻结的图像编码器和冻结的大语言模型接起来。它是一个约 1.88 亿参数、用 BERT-base 初始化的小 Transformer,输入 32 个可学习的查询向量(每个 768 维),通过交叉注意力从图像特征里读信息,输出固定大小的 32×768 特征,远小于 ViT-L/14 原始的 257×1024 特征,相当于一个信息瓶颈。训练分两阶段:先配合图像编码器学图文表征,再接上语言模型学生成。因为只训练 Q-Former 等少量参数,BLIP-2 在零样本 VQAv2 上比 Flamingo-80B 高 8.7%,可训练参数少 54 倍。InstructBLIP 等沿用了它;LLaVA、Prismatic 等则改用更简单的 MLP 投影层,OpenVLA 的底座用的也是 MLP。
例子BLIP-2 把 ViT-g 提取的图像特征交给 Q-Former 压成 32 个向量,经一层线性投影后作为「软视觉提示」拼在 OPT 或 Flan-T5 语言模型的文本输入前面。
- 也叫
- 查询 Transformer、BLIP-2 Q-Former
- 相关
- 投影层、Perceiver 重采样器、可学习查询、交叉注意力、视觉语言模型、视觉编码器
- 来源
- BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models (arXiv 2301.12597)
BLIP-2 full text (HTML, Section 3.1 Model Architecture)