视觉 token
Visual Token常用图像切块并编码后得到的一个个向量,是模型处理图像的基本单位。
视觉 token 是图像进入 Transformer 时的基本单位。常见做法源自 ViT:把图像切成固定大小的图块(patch),每块经视觉编码器变成一个向量,这就是一个视觉 token;视觉语言模型再用投影层把它们映射到和文字 token 相同的空间,与指令拼成一条序列一起处理。token 数随分辨率平方增长:PaliGemma 输入 224 像素图像时是 256 个 token,448 像素是 1024 个,896 像素是 4096 个。机器人通常有多路相机、每秒要推理多次,视觉 token 往往占序列的大头,直接影响推理延迟,所以才有视觉 token 剪枝、重采样等压缩方法。视频模型里对应的单位是时空块。
例子π0 以 PaliGemma 为骨干:每路相机的图像先编码成视觉 token,再和语言指令的 token 拼进同一条序列送入模型。
- 也叫
- 图像 token、图像块、patch、Image Token、Patch Token
- 相关
- 视觉 Transformer、token(词元)、投影层、视觉 token 剪枝、时空块、视觉编码器
- 来源
- An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale (arXiv 2010.11929)
PaliGemma: A versatile 3B VLM for transfer (arXiv 2407.07726)
π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv 2410.24164)