具身智能新手名词表English

潜在动作模型

Latent Action ModelLAM常用

从无标签视频学出潜在动作的模型,靠编码器加解码器重建下一帧来训练。

潜在动作模型是产出潜在动作的那个网络。典型结构来自 DeepMind 2024 年的 Genie:编码器看当前帧和下一帧,输出一个潜在动作,作用相当于逆动力学模型;解码器只拿当前帧和这个潜在动作去重建下一帧,相当于正向动力学模型。中间用向量量化(VQ-VAE 的做法)把潜在动作限制在很小的离散码本里,Genie 只有 8 个码,这样潜在动作装不下整张图,只能记录「发生了什么变化」。训练好后,编码器就能给海量视频打潜在动作标签。常见难点是镜头晃动、背景有人走动等与任务无关的变化也会被编码进去,UniVLA 因此改在 DINO 特征空间里学,并借助语言指令剥离这些干扰。

例子LAPA 分三步:先在视频上训练潜在动作量化模型,再训练 VLA 根据画面和指令预测潜在动作,最后用少量机器人数据微调,把潜在动作换成真实动作。

也叫
隐动作模型
相关
潜在动作、逆动力学模型、正向动力学模型、向量量化变分自编码器、Genie(初代)、UniVLA
来源
Genie: Generative Interactive Environments (arXiv 2402.15391)
Latent Action Pretraining from Videos (LAPA, arXiv 2410.11758)
UniVLA: Learning to Act Anywhere with Task-centric Latent Actions (arXiv 2505.06111)

在完整名词表里查看 →