注意力机制
Attention Mechanism入门必知让模型按相关程度给输入的各部分分配权重,再加权汇总信息的计算方法。
深度学习里的注意力机制一般追溯到 Bahdanau、Cho 和 Bengio 2014 年的神经机器翻译论文:翻译每个词时,模型自动去原句里找最相关的词,而不是把整句压成一个固定长度的向量。现在常用的做法是每个位置生成查询(Q)、键(K)、值(V)三个向量,用 Q 与各个 K 的相似度经 softmax 归一化成权重,再对 V 加权求和。2017 年 Vaswani 等人提出的 Transformer 完全用注意力取代循环和卷积,便于并行训练,此后成为大语言模型和 VLA 的基础结构。在具身模型里,自注意力让图像块、文字和动作 token 相互交换信息,交叉注意力常用来让动作模块读取视觉语言特征。
例子给机器人指令「把红杯子放进水槽」时,模型处理「红杯子」这几个文字 token,注意力权重会集中到画面中红杯子所在的图像块上,把语言和画面对应起来。
- 也叫
- 注意力、Attention
- 相关
- Transformer、自注意力、交叉注意力、因果注意力、注意力掩码、KV 缓存
- 来源
- Neural Machine Translation by Jointly Learning to Align and Translate (arXiv 1409.0473)
Attention Is All You Need (arXiv 1706.03762)
Attention (machine learning) - Wikipedia