自回归视频生成
Autoregressive Video Generation进阶按时间顺序一帧或一段接一段往后生成视频,可以边生成边播放
很多视频扩散模型一次生成整段视频,各帧双向互看,必须等整段算完才能输出,也难以中途接收新的动作输入。自回归视频生成改成按时间顺序往后续写:每一帧或每一小段只以已生成的内容为条件,配合因果注意力和 KV 缓存,就能流式输出、实时响应用户或机器人的动作,这正是可交互世界模型需要的。主要难点是误差累积(曝光偏差):训练时模型看的是真实历史,推理时看的是自己生成的、带误差的历史,时间一长画面会崩。CausVid(CVPR 2025)把双向模型蒸馏成 4 步的因果模型,单卡 9.4 帧/秒;Self Forcing(NeurIPS 2025)在训练时就用模型自己的输出当历史,缩小训练和推理的差距。
例子谷歌 DeepMind 的 Genie 3 逐帧自回归生成画面,每一帧都要参考不断变长的历史轨迹,能以 720p、24 帧/秒实时交互。
- 也叫
- 因果视频生成、Causal Video Generation、流式视频生成
- 相关
- 扩散强制、自强制、可交互世界模型、视频生成模型、曝光偏差(自回归误差累积)、KV 缓存
- 来源
- From Slow Bidirectional to Fast Autoregressive Video Diffusion Models (CausVid, arXiv 2412.07772)
Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion (arXiv 2506.08009)
Genie 3: A new frontier for world models (Google DeepMind) - 信息截至
- 2025-08