位置编码
Positional EncodingPE常用给 Transformer 里每个 token 加上「我在第几个位置」的信息。
Transformer 的自注意力本身不管顺序,把输入 token 打乱,输出只是跟着换位置。为了让模型知道谁先谁后,2017 年的论文《Attention Is All You Need》在输入嵌入上加了一组不同频率的正弦、余弦值,这就是位置编码;作者也试过可学习的位置嵌入,效果几乎一样。之后出现了多种变体:2021 年苏剑林等人提出的旋转位置编码(RoPE)用旋转矩阵编码位置,让注意力分数自然体现相对距离,被 Llama 等主流大模型采用;Qwen2-VL 进一步提出 M-RoPE,把文字顺序、图像的行列和视频的时间一起编码。具身模型要处理多帧图像、多路相机和动作序列,位置编码决定了模型能否分清哪一帧在前、哪块图像在哪。
例子ViT 把 224×224 的图像切成 16×16 像素的小块,共 196 块,每块加上一个可学习的位置嵌入,模型才知道哪块在左上角、哪块在右下角。
- 也叫
- 位置嵌入、Position Embedding
- 相关
- 旋转位置编码、Transformer、自注意力、视觉 Transformer、上下文长度、token(词元)
- 来源
- Attention Is All You Need (arXiv:1706.03762)
RoFormer: Enhanced Transformer with Rotary Position Embedding (arXiv:2104.09864)
Qwen2-VL (arXiv:2409.12191)