具身智能新手名词表English

自强制

Self Forcing进阶

训练时就让视频模型接着自己生成的画面往下生成,消除训练与推理的差异。

Self Forcing 是 Adobe Research 与得克萨斯大学奥斯汀分校的 Xun Huang 等人 2025 年 6 月提出的自回归视频扩散训练方法(NeurIPS 2025 Spotlight)。自回归视频模型一段段往后生成,以往用教师强制(以真实前文为条件)或扩散强制(以加噪的真实前文为条件)训练,推理时却只能接自己生成的、带误差的前文,这种不一致叫曝光偏差,会让长视频越生成越差。Self Forcing 在训练时就按推理方式用 KV 缓存自回归展开,以自己生成的帧为条件,再对整段视频算整体损失。它基于 Wan2.1-T2V-1.3B,在单卡上做到亚秒级延迟的实时流式生成,这对需要边生成边响应动作的交互式世界模型很有用。

例子据项目页,Self Forcing 模型在单张 H100 上以约 16 帧/秒生成 480P 视频,首帧延迟约 0.8 秒,在单张 RTX 4090 上也能实时流式生成。

也叫
自强制训练、Self-Forcing
相关
教师强制、扩散强制、曝光偏差(自回归误差累积)、自回归视频生成、KV 缓存、扩散步数蒸馏
来源
Huang et al. 2025: Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion
Self Forcing 项目页
GitHub: guandeh17/Self-Forcing
信息截至
2025-11

在完整名词表里查看 →