Type: concept
Confidence: 0.90
Created: 2026-04-16
Updated: 2026-04-16
Tags: 技术研究数学信息论

信息熵

概述

信息熵(Information Entropy)是 Shannon (1948) 定义的离散随机变量不确定性的度量:H(X) = -Σ p(xᵢ) log₂ p(xᵢ),是信息论的核心概念,也是 Hartley 信息量在概率框架下的推广。

关键内容

公式

$$H(X) = -\sum_{i=1}^{n} p(x_i) \log_2 p(x_i)$$

三条公理

Shannon 通过三条公理推导出熵是唯一满足以下性质的度量

  1. 连续性:H 关于概率值 pᵢ 是连续的
  2. 单调性:当所有事件等概率时,H 是 n 的单调递增函数
  3. 可分解性:如果一个选择过程可以分解为连续的子选择,总熵等于子选择的加权熵之和

与 Hartley 的关系

当所有符号等概率(pᵢ = 1/s)时,Shannon 熵退化为 Hartley 信息量:H(X) = log s。因此 Hartley 度量是 Shannon 熵在均匀分布下的特殊情况。

直觉解释

命名来源

von Neumann 建议 Shannon 将此量称为"entropy",理由有二: 1. 不确定性函数在统计力学中已有此名 2. "没人知道熵到底是什么意思,所以在辩论中你总有优势"

与 AI 的关系

语言模型的训练目标——最小化下一个 token 的交叉熵——本质上就是在逼近语言的 Shannon 熵率。Shannon 在 1948 年论文中的英语统计模型(0 阶、1 阶、2 阶...)是现代语言模型的直系祖先。

来源

相关