具身智能新手名词表English

向量量化变分自编码器

Vector-Quantized Variational AutoencoderVQ-VAE进阶

编码结果被码本量化成离散编号的自编码器,常用来把图像、视频、动作变成 token。

VQ-VAE 由 DeepMind 的 van den Oord、Vinyals、Kavukcuoglu 在 2017 年提出(NeurIPS 2017)。它和变分自编码器(VAE,把数据压成连续隐变量再还原的生成模型)有两点不同:编码器输出要先经过向量量化,换成码本里最近的码字,所以隐变量是离散的;先验不是固定的高斯分布,而是另外训练一个自回归模型(如 PixelCNN)去学。量化这一步不可求导,训练时用直通估计把解码器端的梯度直接拷给编码器,再加承诺损失让编码器输出靠近码字。它还缓解了 VAE 常见的后验坍缩。后来很多图像、视频分词器和潜在动作模型都建立在它之上。

例子谷歌 DeepMind 的 Genie 用 VQ-VAE 把视频压成离散 token,它的潜在动作模型也用 VQ-VAE 式目标,从没有动作标签的游戏视频里学出只有 8 个码字的离散潜在动作,让人可以逐帧「操控」生成的世界。

也叫
矢量量化变分自编码器、VQ-VAE-2
相关
变分自编码器、向量量化、视频分词器、潜在动作模型、Genie(初代)、LAPA
来源
Neural Discrete Representation Learning (arXiv:1711.00937)
Genie: Generative Interactive Environments (arXiv:2402.15391)

在完整名词表里查看 →