HybridVLA
HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model进阶在同一个大语言模型里同时做扩散和自回归两种动作预测的 VLA
北京大学(仉尚航团队)联合北京智源研究院、香港中文大学、复旦大学 2025 年 3 月发布。自回归 VLA 把动作离散成 token,能继承视觉语言模型的推理能力,但离散化破坏了动作的连续性,影响精细控制;扩散 VLA 另接一个扩散头输出连续动作,却只用到 VLM 提取的特征,没借上逐 token 生成的推理能力。HybridVLA 把扩散去噪直接嵌入大语言模型的下一个 token 预测过程,一个模型同时产出扩散动作和自回归动作,再用「协同动作集成」自适应融合两者。模型基于 Prismatic 7B(LLaMA-2 骨干),论文报告在仿真和真机任务上平均成功率比此前最优方法分别高 14% 和 19%。
例子同一个 HybridVLA 模型每一步会给出扩散和自回归两份动作预测,融合后再交给机械臂执行。
- 也叫
- Hybrid-VLA
- 相关
- 视觉-语言-动作模型、自回归-扩散混合架构、扩散动作头、分箱离散化、CogACT、OpenVLA
- 来源
- HybridVLA (arXiv 2503.10631)
HybridVLA project page
PKU-HMI-Lab/Hybrid-VLA (GitHub) - 信息截至
- 2025-06