最大似然估计 / 负对数似然
Maximum Likelihood Estimation / Negative Log-LikelihoodMLE / NLL常用找一组参数让观测数据出现的概率最大;取负对数后就成了要最小化的损失。
最大似然估计是统计学最基本的参数估计方法:假设数据来自某个带参数的概率模型,选出让已观测数据出现概率(似然)最大的那组参数。计算时取对数把连乘变成求和,再加负号变成最小化问题,这就是深度学习里的负对数似然损失。许多常见损失都是它的特例:分类用的交叉熵是类别分布下的负对数似然;误差服从高斯分布时,最大似然等价于最小化均方误差;误差服从拉普拉斯分布时对应 L1 损失。它也等价于最小化数据分布与模型分布之间的 KL 散度。在具身智能里,行为克隆本质上就是对专家动作做最大似然估计:把动作离散化的 VLA 用交叉熵预测动作 token,高斯策略则直接最小化动作的负对数似然。
例子OpenVLA 把每个动作维度在训练数据 1% 到 99% 分位数之间均匀分成 256 个箱,再用标准的下一个 token 预测目标、只在动作 token 上算交叉熵,这就是在对专家动作做最大似然估计。
- 也叫
- 极大似然估计、对数似然、NLL 损失
- 相关
- 交叉熵、KL 散度、均方误差、行为克隆、损失函数、高斯策略
- 来源
- Maximum likelihood estimation(Wikipedia)
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)