具身智能新手名词表English

动态分辨率(原生分辨率输入)

Dynamic / Native Resolution (Vision Encoder)进阶

视觉编码器按图片原尺寸切块,图越大视觉 token 越多,不再统一缩放。

早期的视觉 Transformer 和 CLIP 类编码器要求把图片统一缩放或裁剪成固定大小(如 224×224),会丢失细节或让长宽比失真。动态分辨率保留原图尺寸和长宽比,直接切成固定大小的图块,图越大 token 越多。谷歌 2023 年的 NaViT 用「序列打包」把不同尺寸的图拼进同一批训练;阿里 2024 年的 Qwen2-VL 提出 Naive Dynamic Resolution,在视觉编码器里用二维旋转位置编码记录每个图块的行列位置,从而处理任意分辨率。好处是小图省算力、大图保细节,代价是 token 数随分辨率增长。用它做 VLA 骨干时通常会限定 token 数上下限,以控制推理延迟。

例子Qwen2-VL 大致每 28×28 像素对应一个视觉 token,默认每张图 4 到 16384 个 token,可用 min_pixels、max_pixels 设定范围来平衡速度和显存。

也叫
原生分辨率、Native Resolution、Naive Dynamic Resolution、任意分辨率输入
相关
视觉编码器、视觉 Transformer、视觉 token、通义千问 Qwen-VL、旋转位置编码、推理延迟
来源
Patch n' Pack: NaViT, a Vision Transformer for any Aspect Ratio and Resolution (arXiv:2307.06304)
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution (arXiv:2409.12191)
Qwen/Qwen2-VL-7B-Instruct model card

在完整名词表里查看 →