ViLLA 架构
Vision-Language-Latent-ActionViLLA进阶智元 GO-1 用的分层架构:先预测潜在动作 token,再解码成真实动作。
ViLLA 是智元机器人 2025 年 3 月发布通用具身基座模型 GO-1(Genie Operator-1)时提出的框架。普通 VLA(视觉-语言-动作模型)从图像和指令直接出动作,ViLLA 在中间加了一层「潜在动作」,分三部分:潜在动作模型(LAM)在人类视频(如 Ego4D)和机器人轨迹上训练,用逆动力学和正向动力学把相邻两帧的变化压成离散的潜在动作 token;潜在规划器以 InternVL2.5-2B 为骨干,根据多视角图像和指令预测这些 token;动作专家再用扩散目标把它们解码成连续的低层动作块。这样做的好处是没有动作标签的人类视频也能参与预训练,提高数据利用率。GO-1 于 2025 年 9 月开源,同时放出去掉潜在规划器的轻量版 GO-1 Air。
例子GO-1 执行一条桌面任务指令时,潜在规划器先根据三路相机画面和指令输出几个潜在动作 token,相当于抽象的「接下来怎么动」;动作专家再以它们为条件去噪,生成未来 30 个时间步的连续动作。
- 也叫
- 视觉-语言-潜在动作架构、潜在规划器 + 动作专家、Latent Planner + Action Expert
- 相关
- 智元 GO-1(启元大模型)、潜在动作模型、潜在动作、动作专家、分层架构、潜在动作预训练
- 来源
- AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems (arXiv:2503.06669)
OpenDriveLab/AgiBot-World (GitHub, GO-1 / GO-1 Air 开源) - 信息截至
- 2025-09