具身智能新手名词表English

LAPA

LAPA: Latent Action Pretraining from Videos常用

用没有动作标签的视频预训练 VLA:先学潜在动作,再用少量真机数据映射成真实动作。

LAPA 由 KAIST、华盛顿大学、微软研究院、英伟达和艾伦人工智能研究所的研究者于 2024 年 10 月提出,发表于 ICLR 2025。VLA 预训练通常需要人工遥操作采来的动作标签,数据来源和规模都受限;LAPA 想直接利用网上大量没有动作标签的视频。它分三步:先用 VQ-VAE 式目标训练一个量化模型,把前后两帧之间的变化编码成离散的潜在动作;再让视觉语言模型(7B 的 LWM)根据画面和任务描述预测这些潜在动作,完成预训练;最后在少量真机数据上微调,把潜在动作映射成真实机器人动作。论文称它在需要语言理解和泛化的真机任务上比用真实动作标签训练的 OpenVLA 高 6.22%,预训练效率高 30 倍以上。

例子只用 Something-Something V2 里约 22 万条人类日常操作视频做潜在动作预训练,再在少量机器人轨迹上微调,效果就超过了用 Bridge 机器人数据预训练的 OpenVLA。

也叫
Latent Action Pretraining for general Action models、潜在动作预训练
相关
潜在动作、潜在动作预训练、潜在动作模型、向量量化变分自编码器、无动作标签视频、OpenVLA
来源
Latent Action Pretraining from Videos (arXiv 2410.11758)
LAPA 项目主页
信息截至
2025-04

在完整名词表里查看 →