视觉基础模型
Vision Foundation ModelVFM常用在海量图像上预训练、能直接或稍加调整用于多种视觉任务的通用模型。
基础模型指在大规模数据上训练、能适配大量下游任务的模型,这个说法由斯坦福团队 2021 年提出;视觉基础模型是其中面向图像的一类。常见三种思路:OpenAI 的 CLIP 用 4 亿对网上图文做对比学习,学到和语言对齐的视觉特征;Meta 的 DINOv2 在 1.42 亿张精选图片上做自监督训练,特征更擅长刻画空间和几何细节;Meta 的 SAM(分割一切模型)能按点或框提示分割任意物体。它们大多基于 ViT。具身智能很少从零训练视觉部分,而是直接接一个现成的 VFM 当视觉编码器,再把特征送进语言模型或策略网络。
例子OpenVLA 把同一张相机图片分别送进 SigLIP 和 DINOv2 两个视觉基础模型,两路特征拼接后经一个两层 MLP 投影到 Llama 2 的输入空间。
- 也叫
- 视觉大模型、Visual Foundation Model
- 相关
- 基础模型、视觉编码器、视觉 Transformer、CLIP、DINOv2、分割一切模型
- 来源
- On the Opportunities and Risks of Foundation Models (arXiv 2108.07258)
DINOv2: Learning Robust Visual Features without Supervision (arXiv 2304.07193)
Learning Transferable Visual Models From Natural Language Supervision (CLIP, arXiv 2103.00020)