具身智能新手名词表English

PaLM-E

PaLM-E: An Embodied Multimodal Language Model常用

谷歌 2023 年把图像和机器人状态接进 PaLM 的具身多模态大模型。

PaLM-E 是谷歌与柏林工业大学在 2023 年 3 月发布的具身多模态语言模型,最大版本 PaLM-E-562B 有 5620 亿参数,由 PaLM 语言模型加 ViT 视觉编码器组成。它把图像、机器人状态估计等连续输入编码成向量,和文字 token 交错拼成「多模态句子」送进语言模型。它输出的是文字形式的中层计划,再交给底层技能策略执行,本身不直接输出电机指令。论文发现把网络图文数据和机器人数据一起训练有正迁移,562B 版本还在 OK-VQA 视觉问答上达到当时最好水平。它是大模型做机器人任务规划的代表工作,也是 RT-2 等 VLA 的前序。

例子给 PaLM-E 一张厨房照片和指令「把抽屉里的薯片拿给我」,它逐步生成「去抽屉旁」「打开抽屉」「拿出薯片」等子步骤,由底层策略依次执行。

也叫
PaLM-E-562B、具身多模态语言模型
相关
SayCan、RT-2、多模态大语言模型、大模型任务规划、视觉 Transformer、语言接地
来源
PaLM-E 项目主页
PaLM-E: An Embodied Multimodal Language Model (arXiv:2303.03378)
信息截至
2023-03

在完整名词表里查看 →