具身智能新手名词表English

RT-2

RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control入门必知

谷歌 DeepMind 2023 年提出,把动作当文字 token 输出,首次提出 VLA 这一名称。

RT-2 是谷歌 DeepMind 于 2023 年 7 月发布的模型,论文首次提出「视觉-语言-动作模型(VLA)」这一名称。做法是:拿在互联网图文上预训练好的视觉语言模型(PaLI-X 和 PaLM-E),把机器人动作的每一维离散成 256 个区间、写成一串数字 token,和普通文字一样让模型输出;训练时把 RT-1 的机器人数据和网络视觉问答数据混在一起协同微调,以免丢掉原有知识。这样机器人能直接用上从网上学到的常识,出现了论文所说的涌现能力:认出机器人数据里没有的物体和符号,理解「最小的」「能临时当锤子用的」这类语义。模型有 120 亿(PaLM-E 版)和 550 亿参数(PaLI-X 版)两种。它开启了后来 OpenVLA、π0 等 VLA 模型的路线。

例子对机器人说「把香蕉移到二加一的和那里」,RT-2 能把香蕉放到写着 3 的位置上,而机器人训练数据里没有这类算术任务。

也叫
Robotics Transformer 2
相关
视觉-语言-动作模型、RT-1、PaLM-E、协同训练、分箱离散化、OpenVLA
来源
RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control (arXiv 2307.15818)
RT-2 项目主页
信息截至
2023-07

在完整名词表里查看 →