Type: concept
Confidence: 0.90
Created: 2026-04-16
Updated: 2026-04-16
Tags: 技术研究数学信息论

交叉熵

概述

交叉熵 H(P,Q) = -Σ P(x) log Q(x) 度量用基于分布 Q 设计的编码来编码来自分布 P 的数据时的平均编码长度,是机器学习分类任务的标准损失函数。

关键内容

定义

$$H(P, Q) = -\sum_x P(x) \log Q(x)$$

与 KL 散度的关系

$$H(P, Q) = H(P) + D_{\text{KL}}(P | Q)$$

交叉熵 = 真实熵 + 模型偏差。由于 H(P) 是常数(不依赖于模型 Q),最小化交叉熵等价于最小化 KL 散度

直觉

如果真实数据来自分布 P,但你以为它来自分布 Q,交叉熵衡量你在这种"错误信念"下编码数据所需的平均比特数。它总是大于等于真实熵 H(P),多出的部分就是 KL 散度。

在机器学习中的核心地位

深度学习分类任务的标准损失函数就是交叉熵损失。当模型输出概率分布 Q,真实标签是 one-hot 分布 P 时,最小化交叉熵就是让模型分布 Q 逼近真实分布 P。

语言模型的训练目标——最小化下一个 token 的交叉熵——本质上就是在让模型的预测分布逼近人类语言的真实条件分布。

来源

相关