KL 散度
Kullback-Leibler DivergenceKL常用衡量一个概率分布偏离另一个分布有多远的量,而且不对称。
KL 散度由 Solomon Kullback 和 Richard Leibler 在 1951 年提出,离散情形下 D_KL(P‖Q)=Σ P(x)·log(P(x)/Q(x)),表示用分布 Q 去近似真实分布 P 时多付出的信息代价。它总是非负,只有两个分布相同时才为 0;但它不对称,D_KL(P‖Q) 一般不等于 D_KL(Q‖P),所以不是严格意义上的距离。机器学习里它随处可见:交叉熵等于 KL 散度加上 P 自身的熵,最小化交叉熵就是在最小化 KL;变分自编码器用 KL 项把隐变量拉向标准正态分布;PPO、RLHF 和部分离线强化学习用 KL 惩罚约束新策略别离参考策略太远;知识蒸馏也用它让学生贴近教师。
例子ACT 的训练损失是动作重建误差加上 β 倍的 KL 项(论文取 β=10),KL 项约束条件变分自编码器编码出的风格变量 z 贴近标准正态分布,推理时直接把 z 设为先验均值 0。
- 也叫
- 相对熵、KL divergence、I 散度
- 相关
- 交叉熵、KL 正则化、变分自编码器、近端策略优化、知识蒸馏、最大似然估计 / 负对数似然
- 来源
- Kullback–Leibler divergence(Wikipedia)
Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT, arXiv 2304.13705)