VLA-Adapter
VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model进阶用 0.5B 小模型加轻量策略模块、不做机器人预训练也能打到顶尖水平的 VLA。
VLA-Adapter 由北京邮电大学、西湖大学、浙江大学、港科大(广州)和 OpenHelix 团队等 2025 年 9 月发布,已开源代码和权重。常见 VLA 依赖大参数视觉语言模型(VLM)并在大量机器人数据上预训练,成本很高。作者系统比较了 VLM 里哪些层、哪些特征最适合作为动作生成的条件,据此设计了一个约 9700 万参数的策略模块:用 Bridge Attention 把 VLM 各层的原始视觉语言特征和一组可学习查询(ActionQuery)的特征注入动作空间,注入多少由可学习参数控制。骨干只用 Qwen2.5-0.5B,不做机器人数据预训练,LIBERO 平均成功率 97.3%(Pro 版 98.5%),CALVIN ABC→D 平均完成长度 4.50(Pro 版)。它大幅降低了训练和部署门槛,后续 VLA-RFT 等工作以它为基座。
例子论文报告在单张消费级显卡上约 8 小时即可训练出可用模型;推理吞吐 219.2 Hz,同条件下 OpenVLA-OFT 为 71.4 Hz。
- 也叫
- VLA-Adapter-Pro
- 相关
- 视觉-语言-动作模型、可学习查询、适配器、OpenVLA-OFT、LIBERO、VLA-RFT
- 来源
- VLA-Adapter (arXiv 2509.09372)
VLA-Adapter 项目主页
OpenHelix-Team/VLA-Adapter (GitHub) - 信息截至
- 2025-09