Flamingo
Flamingo: a Visual Language Model for Few-Shot Learning (DeepMind)进阶DeepMind 2022 年的视觉语言模型,给几个图文示例就能做新任务,是早期 VLM 代表。
Flamingo 是 DeepMind 在 2022 年 4 月发布的视觉语言模型(VLM,能同时看图和读写文字的模型),论文发表于 NeurIPS 2022,最大版本 800 亿参数。它把已经训练好的视觉编码器和语言模型(DeepMind 的 700 亿参数 Chinchilla)冻结不动,中间加两类新模块:Perceiver 重采样器把任意数量的图像特征压成固定数量的视觉 token;门控交叉注意力层插在语言模型里,让它生成文字时能「看」图像。它用网页上图文交错的数据训练,因此能像大语言模型一样做少样本学习:在提示里放几个图文示例,不改参数就能完成新任务。在 16 个基准上,每个任务只给 4 个示例就超过了此前的少样本方法。社区的开源复现 OpenFlamingo 后来被 RoboFlamingo 用作机器人策略的底座。
例子在提示里先放两张带说明文字的动物照片作示例,再放一张新照片,Flamingo 就会照同样格式写出这张照片的说明,全程不需要额外训练。
- 也叫
- DeepMind Flamingo
- 相关
- 视觉语言模型、Perceiver 重采样器、交叉注意力、少样本、上下文学习、RoboFlamingo
- 来源
- Flamingo: a Visual Language Model for Few-Shot Learning (arXiv 2204.14198)
Tackling multiple tasks with a single visual language model (Google DeepMind 博客) - 信息截至
- 2022-04