交叉熵
概述
交叉熵 H(P,Q) = -Σ P(x) log Q(x) 度量用基于分布 Q 设计的编码来编码来自分布 P 的数据时的平均编码长度,是机器学习分类任务的标准损失函数。
关键内容
定义
$$H(P, Q) = -\sum_x P(x) \log Q(x)$$
与 KL 散度的关系
$$H(P, Q) = H(P) + D_{\text{KL}}(P | Q)$$
交叉熵 = 真实熵 + 模型偏差。由于 H(P) 是常数(不依赖于模型 Q),最小化交叉熵等价于最小化 KL 散度。
直觉
如果真实数据来自分布 P,但你以为它来自分布 Q,交叉熵衡量你在这种"错误信念"下编码数据所需的平均比特数。它总是大于等于真实熵 H(P),多出的部分就是 KL 散度。
在机器学习中的核心地位
深度学习分类任务的标准损失函数就是交叉熵损失。当模型输出概率分布 Q,真实标签是 one-hot 分布 P 时,最小化交叉熵就是让模型分布 Q 逼近真实分布 P。
大语言模型的训练目标——最小化下一个 token 的交叉熵——本质上就是在让模型的预测分布逼近人类语言的真实条件分布。
来源
- raw/books/信息论/05_kullback_leibler_1951_information_and_sufficiency.md — Kullback & Leibler (1951) 深度解析