具身智能新手名词表English

视觉 Transformer

Vision TransformerViT常用

把图片切成小方块当作词序列,用 Transformer 处理图像的网络。

视觉 Transformer 由 Google 团队 2020 年在论文「An Image is Worth 16x16 Words」中提出。做法是把图片切成固定大小的小方块(常用 16×16 像素),每块拉平后线性映射成一个向量,加上位置编码(告诉模型每块在哪),当成一串 token 送进标准的 Transformer 编码器;自注意力让每一块都能直接看到全图其他块。此前图像任务主要靠卷积神经网络,ViT 证明在足够大的数据上预训练后,纯 Transformer 也能在 ImageNet 等基准上达到同等水平,而且训练算力更省。今天 CLIP、SigLIP、DINOv2 等视觉基础模型几乎都是 ViT 结构,VLA 的视觉编码器也基本用它。

例子一张 224×224 的图片按 16×16 像素切块,得到 14×14=196 个图块,也就是 196 个视觉 token。

也叫
视觉变换器
相关
Transformer、视觉 token、自注意力、位置编码、卷积神经网络、视觉编码器
来源
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale (arXiv 2010.11929)

在完整名词表里查看 →