Perceiver 重采样器
Perceiver Resampler进阶用少量可学习查询向量,把数量不定的视觉特征压成固定数目的视觉 token。
Perceiver 重采样器是 DeepMind 2022 年在 Flamingo 视觉语言模型中提出的连接模块,思路来自 2021 年的 Perceiver 模型。视觉编码器输出的特征数量随图像分辨率、视频帧数变化,而且往往很多,直接送进语言模型太贵。重采样器预设一小组可学习的查询向量(Flamingo 中是 64 个),让它们通过交叉注意力去「读」全部视觉特征,输出固定数量的视觉 token。Flamingo 的消融实验显示它优于普通 Transformer 和 MLP 做连接。它和 BLIP-2 的 Q-Former 思路相近,都是用查询向量压缩视觉信息。机器人模型里,字节的 GR-1 就用它压缩图像 token。
例子字节 GR-1 先用 MAE 预训练的 ViT 把每帧图像编成大量图块 token,再经 Perceiver 重采样器压成少量 token,然后与语言和机器人状态一起送入 GPT 式 Transformer,预测动作和未来画面。
- 也叫
- Perceiver、感知器重采样器
- 相关
- 投影层、Q-Former、可学习查询、交叉注意力、视觉 token、字节 GR-1
- 来源
- Flamingo: a Visual Language Model for Few-Shot Learning (arXiv:2204.14198)
Perceiver: General Perception with Iterative Attention (arXiv:2103.03206)
Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation (GR-1, arXiv:2312.13139)