视频分词器
Video Tokenizer / Video VAE进阶把视频压成少量 token 或潜在向量、又能还原回画面的编解码网络。
视频分词器是视频生成模型和世界模型的前置模块:编码器把一段视频在时间和空间上同时压缩,得到离散 token 或连续潜在向量,解码器再还原成像素。输出离散 token 的一类(如谷歌的 MAGVIT-v2)靠量化把向量变成「词表编号」,方便接自回归 Transformer;输出连续向量的一类就是视频 VAE(变分自编码器),供潜在扩散模型在里面去噪。「因果」指时间方向上每帧只看前面的帧、第一帧单独编码,这样图像和视频能共用一个分词器,也能分段处理任意长的视频。压缩率决定后面的大模型要处理多少 token,重建质量又决定生成画面的清晰度上限。英伟达 Cosmos Tokenizer 提供 4×8×8、8×16×16 等多档压缩的连续和离散版本。
例子通义万相 Wan2.1 的 Wan-VAE 是 3D 因果 VAE,时间压 4 倍、长宽各压 8 倍,靠特征缓存能编解码任意长度的 1080P 视频;扩散 Transformer 只在压缩后的潜在空间里去噪,最后交给解码器还原成画面。
- 也叫
- 视频 VAE、3D 因果 VAE、Causal Video VAE、视频 tokenizer
- 相关
- 变分自编码器、潜在空间、时空块、向量量化、潜在扩散模型、Cosmos
- 来源
- Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation (MAGVIT-v2, arXiv:2310.05737)
NVIDIA Cosmos Tokenizer (GitHub)
Wan: Open and Advanced Large-Scale Video Generative Models (arXiv:2503.20314)