高斯最小二乘法
概述
通过最小化残差平方和来拟合数据、估计参数的方法,是统计回归、信号处理和机器学习的数学基石。勒让德于1805年首次公开发表,高斯于1809年在《天体运动论》中发表并建立其概率论基础——证明在正态误差假设下,最小二乘估计等价于最大似然估计。高斯声称自己从1795年起即已使用。
关键内容
核心问题
设有 $n$ 次观测和 $p$ 个未知参数($n > p$),最小二乘问题为:
$$\min_{\boldsymbol{\beta}} S = \sum_{i=1}^n [y_i - \hat{y}_i(\boldsymbol{\beta})]^2$$
线性情形下,设计矩阵 $A$($n \times p$)使问题变为 $\min |A\boldsymbol{\beta} - \mathbf{y}|_2^2$。
正规方程
对目标函数求导令其为零,得正规方程(normal equations):
$$A^T A \boldsymbol{\beta} = A^T \mathbf{y}$$
当 $A$ 列满秩时,唯一解为 $\hat{\boldsymbol{\beta}} = (A^T A)^{-1} A^T \mathbf{y}$。
几何解释
最小二乘解 $\hat{\mathbf{y}} = A\hat{\boldsymbol{\beta}}$ 是观测向量 $\mathbf{y}$ 在 $A$ 的列空间上的正交投影,残差向量垂直于列空间。
统计理论基础
- 与MLE的等价性:误差服从正态分布 $N(0, \sigma^2)$ 时,最小二乘估计 = 最大似然估计
- 高斯-马尔可夫定理:仅要求误差零均值、等方差、不相关(无需正态性),最小二乘是所有线性无偏估计中方差最小者(BLUE: Best Linear Unbiased Estimator)
为何用平方和
- 数学便利:平方函数处处可微,可用微积分求极值
- 统计最优:正态误差假设下等价于MLE
- 大偏差惩罚重:偏差翻倍,惩罚增加四倍,促使误差均匀分布
主要变体
| 变体 | 特点 |
|---|---|
| 加权最小二乘(WLS) | 不同观测精度不同,权重 $w_i = 1/\sigma_i^2$ |
| 岭回归(Ridge) | 加 $\lambda|\boldsymbol{\beta}|_2^2$ 惩罚,处理多重共线性 |
| LASSO | 加 $\lambda|\boldsymbol{\beta}|_1$ 惩罚,产生稀疏解 |
| 非线性最小二乘 | 用高斯-牛顿法、Levenberg-Marquardt法迭代求解 |
数值求解建议
直接求解正规方程数值不稳定($A^T A$ 条件数是 $A$ 条件数的平方)。应优先使用 QR分解 或 SVD。
历史意义
1801年高斯用该方法从40天观测数据预测谷神星轨道,误差仅约半度,一举成名。该方法将过定方程组的求解从"艺术"变为有理论基础的"科学",催生了现代统计学(线性回归)和数值线性代数(QR分解、SVD)。
局限性
- 对异常值敏感(催生了稳健统计学:Huber M-估计等)
- 正态分布假设在实践中不总成立(金融数据常为厚尾)
- 高维情形($p > n$)无唯一解,需正则化
影响的后续方向
- 回归分析(线性回归 → GLM → 贝叶斯回归)
- 信号处理(维纳滤波、卡尔曼滤波、LMS算法)
- 机器学习(MSE损失函数、SVM变体、PCA)
- 数值线性代数(QR分解、SVD、LSQR算法)
- 大地测量与GPS定位
来源
- raw/books/数值分析/03_gauss_least_squares.md