具身智能新手名词表English

RoboVLMs

RoboVLMs (What Matters in Building Vision-Language-Action Models for Generalist Robots)进阶

系统比较 VLA 骨干、结构和训练数据该怎么选的实验研究与开源框架

RoboVLMs 由清华大学、字节跳动研究院、中科院自动化所、上海交通大学、新加坡国立大学等在 2024 年 12 月发布,既是一篇系统实验研究,也是同名开源框架,可以方便地把新的视觉语言模型接成 VLA。它回答搭 VLA 时的几个关键选择:选哪个 VLM 骨干、动作输出和历史信息怎么组织、跨本体数据什么时候加入。作者比较了 8 种以上 VLM 骨干和 4 种策略结构,跑了 600 多组实验。主要结论包括:用连续动作的独立策略头、并输入多帧历史的结构表现最好;视觉-语言预训练充分的骨干(如 KosMos、PaliGemma)明显更好;先用跨本体数据预训练更有助于鲁棒性。最佳配置在 CALVIN 上平均连续完成 4.49 个任务。

例子想试一个新的视觉语言模型做 VLA 骨干时,可以在 RoboVLMs 框架里只替换骨干,其余设置不变,直接与 KosMos、PaliGemma 版本在 CALVIN 上对比。

也叫
Towards Generalist Robot Policies: What Matters in Building Vision-Language-Action Models
相关
视觉-语言-动作模型、RoboFlamingo、动作头、跨本体数据、PaliGemma、消融实验
来源
arXiv 2412.14058: RoboVLMs
RoboVLMs 项目主页
信息截至
2026-02

在完整名词表里查看 →