视觉编码器
Vision Encoder入门必知把图像转成一组特征向量(视觉 token)供后续模型使用的网络。
视觉编码器负责把像素变成模型能用的特征:输入一张图,输出一组向量,每个向量概括图中一小块区域的内容。早期多用卷积神经网络(如 ResNet),现在主流是视觉 Transformer(ViT),它把图像切成小块(原版 ViT 是 16×16 像素),每块先变成一个向量,再用注意力让各块互相交换信息。编码器的能力主要来自预训练:OpenAI 2021 年的 CLIP 用 4 亿对网络图文训练,把图像和文字对齐到同一空间;SigLIP 是谷歌在它基础上改进的版本;Meta 的 DINOv2 只用图像做自监督训练,保留的空间和几何细节更多。VLA 通常直接用现成的视觉编码器,经投影层把特征接到语言模型上,训练时可冻结,也可一起微调。
例子OpenVLA 把 224×224 的图像同时送进 SigLIP 和 DINOv2,把两路特征按通道拼在一起,再用一个两层 MLP 投影层变成语言模型能读的视觉 token。
- 也叫
- 图像编码器、Image Encoder、视觉骨干网络
- 相关
- 视觉 Transformer、CLIP、SigLIP、DINOv2、投影层、视觉 token
- 来源
- An Image is Worth 16x16 Words (ViT, arXiv:2010.11929)
Learning Transferable Visual Models From Natural Language Supervision (CLIP, arXiv:2103.00020)
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv:2406.09246) - 信息截至
- 2024-06