因果注意力
Causal Attention常用每个位置只能看自己和前面的内容,看不到后面的注意力。
因果注意力是在自注意力里加一个掩码,把「未来位置」的注意力分数设为负无穷,让每个 token 只能关注自己和前面的 token。它来自 2017 年 Transformer 原论文的解码器,用来保证自回归:训练时一次喂入整段序列,预测第 i 个位置也只依赖前面的内容。GPT、Llama 等仅解码器语言模型都用它,基于它们的 VLA 逐个生成动作 token 时也是。与之相对的是双向注意力,所有位置互相可见,BERT、ViT 用的就是这种。两者也常混用:π0 用分块因果掩码,把输入分成图像和语言、机器人状态、带噪动作三块,块内互相可见,每块只能看自己和前面的块。
例子序列「拿 起 杯 子」中,模型计算「杯」时只能关注「拿」「起」「杯」三个位置,「子」被掩码挡住。
- 也叫
- 因果掩码、掩码自注意力、Causal Mask、Masked Self-Attention
- 相关
- 自注意力、注意力掩码、仅解码器架构、自回归解码、KV 缓存、Transformer
- 来源
- Attention Is All You Need (arXiv:1706.03762)
π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164)