自注意力
Self-Attention常用让序列中每个元素参考同一序列其他元素、按相关度汇总信息的机制。
自注意力是 Transformer 的核心运算,因 2017 年 Vaswani 等人的论文《Attention Is All You Need》而普及。对序列里每个 token,先用可学习矩阵算出查询(Q)、键(K)、值(V)三个向量;拿它的查询与所有 token 的键做点积,经 Softmax 变成权重,再对值加权求和,得到它的新表示。「自」指查询和键值来自同一条序列,来自不同序列就叫交叉注意力。它一步就能连接任意两个位置、便于并行,但计算量随序列长度平方增长。VLA 里图像、文字、状态 token 常放进同一个自注意力里混合,再用注意力掩码规定谁能看谁。
例子π0 把图像、语言指令、机器人状态和带噪动作的 token 拼成一条序列,经自注意力相互交换信息,最后从动作 token 的输出解出动作。
- 也叫
- 内部注意力、Intra-Attention、多头自注意力、Multi-Head Self-Attention
- 相关
- 注意力机制、Transformer、交叉注意力、注意力掩码、Softmax(归一化指数函数)、位置编码
- 来源
- Attention Is All You Need (arXiv 1706.03762)
Dive into Deep Learning: Self-Attention and Positional Encoding