具身智能新手名词表English

自回归视频生成

Autoregressive Video Generation进阶

按时间顺序一帧或一段接一段往后生成视频,可以边生成边播放

很多视频扩散模型一次生成整段视频,各帧双向互看,必须等整段算完才能输出,也难以中途接收新的动作输入。自回归视频生成改成按时间顺序往后续写:每一帧或每一小段只以已生成的内容为条件,配合因果注意力和 KV 缓存,就能流式输出、实时响应用户或机器人的动作,这正是可交互世界模型需要的。主要难点是误差累积(曝光偏差):训练时模型看的是真实历史,推理时看的是自己生成的、带误差的历史,时间一长画面会崩。CausVid(CVPR 2025)把双向模型蒸馏成 4 步的因果模型,单卡 9.4 帧/秒;Self Forcing(NeurIPS 2025)在训练时就用模型自己的输出当历史,缩小训练和推理的差距。

例子谷歌 DeepMind 的 Genie 3 逐帧自回归生成画面,每一帧都要参考不断变长的历史轨迹,能以 720p、24 帧/秒实时交互。

也叫
因果视频生成、Causal Video Generation、流式视频生成
相关
扩散强制、自强制、可交互世界模型、视频生成模型、曝光偏差(自回归误差累积)、KV 缓存
来源
From Slow Bidirectional to Fast Autoregressive Video Diffusion Models (CausVid, arXiv 2412.07772)
Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion (arXiv 2506.08009)
Genie 3: A new frontier for world models (Google DeepMind)
信息截至
2025-08

在完整名词表里查看 →