具身智能新手名词表English

TokenLearner

进阶

从大量图像 token 里自适应地汇总出少数几个关键 token 的模块,用来省算力。

TokenLearner 是谷歌 Ryoo 等人 2021 年提出的模块(NeurIPS 2021),论文标题问的就是「8 个学出来的 token 能做什么」。视觉 Transformer 通常把图像切成几十到几百个块,每块一个 token,注意力计算量随 token 数平方增长。TokenLearner 根据输入内容为每个输出 token 算一张空间注意力图,用它对特征图加权汇总,把大量 token 压缩成 8 个左右,后面的层只处理这几个 token。论文在 ImageNet 和 Kinetics 等视频识别基准上以明显更少的计算量取得有竞争力的结果。它在具身领域最出名的用法是谷歌的 RT-1,用来让大模型满足实时控制的速度要求。

例子RT-1 用 TokenLearner 把每张图的 81 个视觉 token 压到 8 个,6 帧历史一共 48 个 token 送入 Transformer;论文称这一步让推理加速约 2.4 倍。

也叫
Token 学习器
相关
视觉 token、视觉 token 剪枝、RT-1、Perceiver 重采样器、Q-Former、视觉 Transformer
来源
TokenLearner: What Can 8 Learned Tokens Do for Images and Videos? (arXiv:2106.11297)
RT-1: Robotics Transformer for Real-World Control at Scale (arXiv:2212.06817)

在完整名词表里查看 →