信息熵
概述
信息熵(Information Entropy)是 Shannon (1948) 定义的离散随机变量不确定性的度量:H(X) = -Σ p(xᵢ) log₂ p(xᵢ),是信息论的核心概念,也是 Hartley 信息量在概率框架下的推广。
关键内容
公式
$$H(X) = -\sum_{i=1}^{n} p(x_i) \log_2 p(x_i)$$
三条公理
Shannon 通过三条公理推导出熵是唯一满足以下性质的度量:
- 连续性:H 关于概率值 pᵢ 是连续的
- 单调性:当所有事件等概率时,H 是 n 的单调递增函数
- 可分解性:如果一个选择过程可以分解为连续的子选择,总熵等于子选择的加权熵之和
与 Hartley 的关系
当所有符号等概率(pᵢ = 1/s)时,Shannon 熵退化为 Hartley 信息量:H(X) = log s。因此 Hartley 度量是 Shannon 熵在均匀分布下的特殊情况。
直觉解释
- 抛一枚公平硬币:1 bit 不确定性
- 掷一个公平骰子:log₂ 6 ≈ 2.58 bit
- 硬币 99% 正面朝上:约 0.08 bit(几乎可以确定结果)
命名来源
von Neumann 建议 Shannon 将此量称为"entropy",理由有二: 1. 不确定性函数在统计力学中已有此名 2. "没人知道熵到底是什么意思,所以在辩论中你总有优势"
与 AI 的关系
大语言模型的训练目标——最小化下一个 token 的交叉熵——本质上就是在逼近语言的 Shannon 熵率。Shannon 在 1948 年论文中的英语统计模型(0 阶、1 阶、2 阶...)是现代语言模型的直系祖先。
来源
- raw/books/信息论/02_shannon_1948_mathematical_theory_of_communication.md — Shannon (1948) 深度解析
- raw/books/计算机科学/02-shannon-mathematical-theory-of-communication.md — Shannon (1948) 计算机科学视角深度解析
相关
- 克劳德·香农 — 提出者
- 信息论 — 所属学科
- Hartley信息量 — 均匀分布下的特殊情况
- 信息与语义分离 — 认识论基础