具身智能新手名词表English

达摩院 RynnVLA-002

RynnVLA-002: A Unified Vision-Language-Action and World Model (Alibaba DAMO)进阶

阿里达摩院把动作模型和世界模型合进同一个自回归网络的开源 VLA

阿里巴巴达摩院 2025 年 11 月发布并开源。前作 RynnVLA-001(2025 年 8 月)是一个 7B 参数的 VLA,先在人类第一视角视频上做视频生成预训练,再把学到的操作技能迁移到机械臂。RynnVLA-002 把两类模型合在一起:VLA 部分根据图像和语言指令输出动作,世界模型部分根据当前画面和动作预测接下来的画面。两者共用一个基于 Chameleon 的自回归主干,把图像、文字和动作都当作 token 处理,另加一个输出连续动作的 Action Transformer,并支持腕部相机和机器人状态输入。作者的观点是:学会预测「动作会让画面怎样变化」能帮模型理解物理规律,反过来提升动作质量。论文报告它在不做预训练的情况下 LIBERO 仿真基准成功率 97.4%,在 LeRobot 真机任务上加入世界模型后成功率提升约 50%。

例子同一个模型既能根据「把积木放进盒子」输出下一段机械臂动作,也能根据给定的动作生成执行后腕部相机会看到的画面。

也叫
RynnVLA
相关
世界动作模型、世界模型、视觉-语言-动作模型、WorldVLA、LIBERO、达摩院 RynnBrain
来源
RynnVLA-002: A Unified Vision-Language-Action and World Model (arXiv 2511.17502)
alibaba-damo-academy/RynnVLA-002 (GitHub)
alibaba-damo-academy/RynnVLA-001 (GitHub)
信息截至
2026-05

在完整名词表里查看 →