UniVLA
UniVLA: Learning to Act Anywhere with Task-centric Latent Actions进阶从视频里学「与任务相关的潜在动作」来训练跨本体 VLA 的框架
香港大学 OpenDriveLab 与智元机器人 2025 年 5 月发布,发表于 RSS 2025。多数 VLA(视觉-语言-动作模型)依赖大量带动作标签的机器人数据,且被绑在某一种机器人上。UniVLA 先训练潜在动作模型:在 DINOv2 特征空间里看前后两帧,结合语言指令,把与任务有关的变化和镜头晃动等无关变化分开,量化成离散的潜在动作 token,这样没有动作标签的视频(包括人类视频)也能用来预训练。之后以 Prismatic-7B 为底座预测潜在动作,部署到具体机器人时只加一个约 1200 万参数的解码头把它翻译成真实动作。论文称预训练算力不到 OpenVLA 的 1/20、下游数据只用 1/10,就在 LIBERO、CALVIN、R2R 等基准上超过它。
例子把机械臂数据、导航数据和人类操作视频一起喂给 UniVLA 的潜在动作模型,学到的同一套潜在动作,接上不同的小解码头后,可以分别驱动 LIBERO 仿真里的机械臂和 R2R 里的导航智能体。
- 相关
- 潜在动作模型、潜在动作、视觉-语言-动作模型、OpenVLA、LAPA、跨本体
- 来源
- UniVLA (arXiv 2505.06111)
OpenDriveLab/UniVLA GitHub - 信息截至
- 2025-05