具身智能新手名词表English

Flamingo

Flamingo: a Visual Language Model for Few-Shot Learning (DeepMind)进阶

DeepMind 2022 年的视觉语言模型,给几个图文示例就能做新任务,是早期 VLM 代表。

Flamingo 是 DeepMind 在 2022 年 4 月发布的视觉语言模型(VLM,能同时看图和读写文字的模型),论文发表于 NeurIPS 2022,最大版本 800 亿参数。它把已经训练好的视觉编码器和语言模型(DeepMind 的 700 亿参数 Chinchilla)冻结不动,中间加两类新模块:Perceiver 重采样器把任意数量的图像特征压成固定数量的视觉 token;门控交叉注意力层插在语言模型里,让它生成文字时能「看」图像。它用网页上图文交错的数据训练,因此能像大语言模型一样做少样本学习:在提示里放几个图文示例,不改参数就能完成新任务。在 16 个基准上,每个任务只给 4 个示例就超过了此前的少样本方法。社区的开源复现 OpenFlamingo 后来被 RoboFlamingo 用作机器人策略的底座。

例子在提示里先放两张带说明文字的动物照片作示例,再放一张新照片,Flamingo 就会照同样格式写出这张照片的说明,全程不需要额外训练。

也叫
DeepMind Flamingo
相关
视觉语言模型、Perceiver 重采样器、交叉注意力、少样本、上下文学习、RoboFlamingo
来源
Flamingo: a Visual Language Model for Few-Shot Learning (arXiv 2204.14198)
Tackling multiple tasks with a single visual language model (Google DeepMind 博客)
信息截至
2022-04

在完整名词表里查看 →