交叉熵
Cross-EntropyCE常用衡量模型预测的概率分布离正确答案有多远,是分类任务最常用的损失。
交叉熵来自信息论,用来衡量两个概率分布的差异。深度学习里把它当分类损失:模型对每个类别输出概率(通常经 Softmax 归一化),正确类别的预测概率越低,损失越大;标签只有一个正确类别时,它就等于负对数似然(NLL)。大语言模型的下一个 token 预测,就是在整个词表上算交叉熵。具身里,把连续动作离散成 token 的 VLA(如 RT-2、OpenVLA)同样用交叉熵训练动作输出;直接回归连续动作的策略多用均方误差或 L1 损失,扩散和流匹配策略则用各自的去噪损失。
例子OpenVLA 把每个动作维度按训练数据的 1% 到 99% 分位区间均分成 256 个桶,用它们覆盖 Llama 词表里最少用的 256 个 token,训练时只在动作 token 上计算交叉熵损失。
- 也叫
- 交叉熵损失、Cross-Entropy Loss、对数损失、Log Loss
- 相关
- 损失函数、下一个 token 预测、分箱离散化、均方误差、KL 散度、最大似然估计 / 负对数似然
- 来源
- Google Machine Learning Glossary: cross-entropy
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)