教师强制
Teacher Forcing进阶训练序列模型时每一步都喂真实的上一步,而不是模型自己的预测。
教师强制是训练自回归序列模型的标准做法,1989 年由 Williams 和 Zipser 命名:预测第 t 步时,输入用数据里真实的前 t−1 步,而不是模型自己生成的结果。这样各步能并行算损失,训练快且稳,大语言模型和 RT-2、OpenVLA 这类把动作离散成 token 的 VLA 都这样训练。代价是训练和推理不一致:推理时模型只能接着自己的输出往下写,早期小错会累积,这叫曝光偏差。计划采样(2015)在训练中逐步混入模型自己的预测;视频生成里的 Self Forcing(2025)则在训练时直接自回归展开。
例子训练 OpenVLA 时,每步动作被离散成 7 个 token,第 k 个 token 以真实的前 k−1 个 token 为条件来预测;部署时则只能接在模型自己刚生成的 token 后面继续解码。
- 也叫
- 教师强迫
- 相关
- 下一个 token 预测、自回归解码、曝光偏差(自回归误差累积)、自强制、扩散强制、复合误差
- 来源
- Wikipedia: Teacher forcing
Bengio et al. 2015: Scheduled Sampling for Sequence Prediction with Recurrent Neural Networks
Huang et al. 2025: Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion