具身智能新手名词表English

自回归解码

Autoregressive DecodingAR入门必知

一个接一个地生成输出,每一步都以前面已生成的内容为条件。

自回归解码是 GPT 等大语言模型生成文字的方式:每次只预测下一个 token,接到输入末尾再预测下一个,直到结束。用到机器人上,要先把连续动作离散成 token。Google DeepMind 2023 年的 RT-2 把动作写成一串数字 token,让视觉语言模型像输出文字一样输出;OpenVLA 把每个动作维度分成 256 个区间,占用 Llama 词表里最少用的 256 个 token。好处是直接复用语言模型的结构和训练方法;缺点是要一个个生成,速度慢,OpenVLA 在一张 RTX 4090 上约 6Hz。所以后来有了 FAST 等压缩动作的分词器、并行解码,以及改用扩散或流匹配生成动作的方案。

例子RT-2 的一个动作输出就是一串 token,形如「1 128 91 241 5 101 127 217」,依次对应是否结束任务、末端位移和旋转、夹爪开合等维度的离散值,再换算回连续数值发给机器人。

也叫
自回归、自回归模型、Autoregressive Model、逐 token 生成
相关
下一个 token 预测、动作分词器、分箱离散化、并行解码、RT-2、OpenVLA
来源
RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control(项目页)
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)

在完整名词表里查看 →