具身智能新手名词表English

WorldVLA

WorldVLA: Towards Autoregressive Action World Model进阶

阿里达摩院把 VLA 和世界模型合进一个自回归模型,既出动作又预测下一帧

阿里达摩院 2025 年 6 月发布的工作,基于 Chameleon 这类图文统一的自回归模型,把图像、文字、动作都转成 token 放进同一个 Transformer。同一模型兼任两个角色:作为动作模型,根据画面和指令生成动作;作为世界模型,根据当前画面和动作预测下一帧画面。作者发现两者联合训练能互相提升。另一个发现是自回归地连续生成多个动作时,前面动作的误差会传给后面,于是提出一种注意力掩码,生成当前动作时屏蔽之前的动作、只看图像和指令,在 LIBERO 上明显改善多步动作生成。2025 年 11 月项目升级为 RynnVLA-002。

例子在 LIBERO 仿真任务中,同一个模型既能输出机械臂下一段动作,也能在给定动作后生成接下来的画面帧。

相关
世界动作模型、视觉-语言-动作模型、自回归解码、注意力掩码、达摩院 RynnVLA-002、阿里达摩院
来源
WorldVLA (arXiv:2506.21539)
alibaba-damo-academy/WorldVLA (GitHub)
信息截至
2025-11

在完整名词表里查看 →