具身智能新手名词表English

Transformer

入门必知

以注意力机制为核心的神经网络架构,是大模型和 VLA 的共同主干。

Transformer 由谷歌团队在 2017 年的论文《Attention Is All You Need》中提出,最初用于机器翻译。它完全去掉了循环和卷积结构,只靠注意力机制(让序列里每个 token 直接参考其他所有 token,按相关程度加权汇总信息)处理序列。相比逐步处理的循环神经网络,它能并行计算、训练更快、更容易扩大规模,因此成了 GPT、Llama 等大语言模型和 ViT 等视觉模型的共同架构。原版是编码器-解码器结构,GPT 类模型只用解码器部分。机器人领域在 2022 年前后开始大量采用,谷歌的 RT-1(Robotics Transformer)是代表之一;如今的 VLA、世界模型和不少扩散策略都以 Transformer 为主干。

例子OpenVLA 的主干 Llama 2 是一个仅解码器的 Transformer:图像 token 和指令 token 排成一个序列输入,模型再逐个输出代表动作的 token。

也叫
Transformer 架构、变换器
相关
注意力机制、自注意力、仅解码器架构、编码器-解码器、视觉 Transformer、RT-1
来源
Attention Is All You Need (Vaswani et al., arXiv:1706.03762)
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv:2406.09246)

在完整名词表里查看 →