具身智能新手名词表English

ViLLA 架构

Vision-Language-Latent-ActionViLLA进阶

智元 GO-1 用的分层架构:先预测潜在动作 token,再解码成真实动作。

ViLLA 是智元机器人 2025 年 3 月发布通用具身基座模型 GO-1(Genie Operator-1)时提出的框架。普通 VLA(视觉-语言-动作模型)从图像和指令直接出动作,ViLLA 在中间加了一层「潜在动作」,分三部分:潜在动作模型(LAM)在人类视频(如 Ego4D)和机器人轨迹上训练,用逆动力学和正向动力学把相邻两帧的变化压成离散的潜在动作 token;潜在规划器以 InternVL2.5-2B 为骨干,根据多视角图像和指令预测这些 token;动作专家再用扩散目标把它们解码成连续的低层动作块。这样做的好处是没有动作标签的人类视频也能参与预训练,提高数据利用率。GO-1 于 2025 年 9 月开源,同时放出去掉潜在规划器的轻量版 GO-1 Air。

例子GO-1 执行一条桌面任务指令时,潜在规划器先根据三路相机画面和指令输出几个潜在动作 token,相当于抽象的「接下来怎么动」;动作专家再以它们为条件去噪,生成未来 30 个时间步的连续动作。

也叫
视觉-语言-潜在动作架构、潜在规划器 + 动作专家、Latent Planner + Action Expert
相关
智元 GO-1(启元大模型)、潜在动作模型、潜在动作、动作专家、分层架构、潜在动作预训练
来源
AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems (arXiv:2503.06669)
OpenDriveLab/AgiBot-World (GitHub, GO-1 / GO-1 Air 开源)
信息截至
2025-09

在完整名词表里查看 →