变分自编码器
Variational AutoencoderVAE常用把数据压成服从某种分布的潜变量,并能从中采样还原或生成数据的模型。
变分自编码器由 Kingma 和 Welling 于 2013 年提出,是一种生成模型。编码器把输入(如一张图)压成低维潜变量,但输出的是一个分布(均值和方差)而不是一个固定点;解码器从这个分布里采样,再还原出数据。训练时同时要求重建得像、潜在分布接近标准正态分布,后者让潜在空间连续平滑,随便采一个点也能解码出合理结果。靠重参数化技巧,这种带随机采样的模型也能用梯度下降训练。它今天最常见的用途是给扩散模型当压缩器:Stable Diffusion、通义万相 Wan 等先用 VAE 把像素压到潜在空间再去噪;机器人里 ACT 用它的条件版本 CVAE 来刻画演示动作的多样性。
例子Stable Diffusion 的 VAE 把 512×512 的彩色图片压成 64×64×4 的潜变量,扩散模型只在这个小得多的空间里去噪,最后再由解码器还原成图片。
- 也叫
- 变分自动编码器
- 相关
- 自编码器、潜在空间、条件变分自编码器、向量量化变分自编码器、潜在扩散模型、视频分词器
- 来源
- Auto-Encoding Variational Bayes (arXiv 1312.6114)
High-Resolution Image Synthesis with Latent Diffusion Models (arXiv 2112.10752)