下一个 token 预测
Next-Token PredictionNTP常用根据前面所有 token,预测序列里下一个 token 的训练目标。
GPT 系列大语言模型的核心训练目标:把文本切成 token(词元),模型读入前面的 token,输出下一个 token 的概率分布,用交叉熵损失把真实下一个 token 的概率往上推。它只需要原始文本、不需要人工标注,所以能在海量数据上预训练,OpenAI 2018 年的 GPT-1 就用它做生成式预训练。推理时模型一个接一个生成 token,叫自回归解码。具身智能里,RT-2、OpenVLA 把连续动作离散成 token,和文字放进同一序列,沿用这个目标训练 VLA;伯克利团队 2024 年还把人形机器人行走建模成下一个 token 预测。代价是离散化有精度损失、逐个生成较慢,所以也有模型改用扩散或流匹配动作头。
例子OpenVLA 把每个动作维度按训练数据分布切成 256 个区间,用 Llama 词表里最少用的 256 个 token 表示,再用标准的下一个 token 预测训练,只在动作 token 上算交叉熵。
- 也叫
- 自回归预训练、自回归语言建模、Causal Language Modeling
- 相关
- 自回归解码、动作分词器、分箱离散化、教师强制、交叉熵、视觉-语言-动作模型
- 来源
- Improving Language Understanding by Generative Pre-Training (GPT-1, OpenAI 2018)
OpenVLA: An Open-Source Vision-Language-Action Model
Humanoid Locomotion as Next Token Prediction