Transformer
入门必知以注意力机制为核心的神经网络架构,是大模型和 VLA 的共同主干。
Transformer 由谷歌团队在 2017 年的论文《Attention Is All You Need》中提出,最初用于机器翻译。它完全去掉了循环和卷积结构,只靠注意力机制(让序列里每个 token 直接参考其他所有 token,按相关程度加权汇总信息)处理序列。相比逐步处理的循环神经网络,它能并行计算、训练更快、更容易扩大规模,因此成了 GPT、Llama 等大语言模型和 ViT 等视觉模型的共同架构。原版是编码器-解码器结构,GPT 类模型只用解码器部分。机器人领域在 2022 年前后开始大量采用,谷歌的 RT-1(Robotics Transformer)是代表之一;如今的 VLA、世界模型和不少扩散策略都以 Transformer 为主干。
例子OpenVLA 的主干 Llama 2 是一个仅解码器的 Transformer:图像 token 和指令 token 排成一个序列输入,模型再逐个输出代表动作的 token。
- 也叫
- Transformer 架构、变换器
- 相关
- 注意力机制、自注意力、仅解码器架构、编码器-解码器、视觉 Transformer、RT-1
- 来源
- Attention Is All You Need (Vaswani et al., arXiv:1706.03762)
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv:2406.09246)