具身智能新手名词表English

HybridVLA

HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model进阶

在同一个大语言模型里同时做扩散和自回归两种动作预测的 VLA

北京大学(仉尚航团队)联合北京智源研究院、香港中文大学、复旦大学 2025 年 3 月发布。自回归 VLA 把动作离散成 token,能继承视觉语言模型的推理能力,但离散化破坏了动作的连续性,影响精细控制;扩散 VLA 另接一个扩散头输出连续动作,却只用到 VLM 提取的特征,没借上逐 token 生成的推理能力。HybridVLA 把扩散去噪直接嵌入大语言模型的下一个 token 预测过程,一个模型同时产出扩散动作和自回归动作,再用「协同动作集成」自适应融合两者。模型基于 Prismatic 7B(LLaMA-2 骨干),论文报告在仿真和真机任务上平均成功率比此前最优方法分别高 14% 和 19%。

例子同一个 HybridVLA 模型每一步会给出扩散和自回归两份动作预测,融合后再交给机械臂执行。

也叫
Hybrid-VLA
相关
视觉-语言-动作模型、自回归-扩散混合架构、扩散动作头、分箱离散化、CogACT、OpenVLA
来源
HybridVLA (arXiv 2503.10631)
HybridVLA project page
PKU-HMI-Lab/Hybrid-VLA (GitHub)
信息截至
2025-06

在完整名词表里查看 →