Type: concept
Confidence: 0.90
Created: 2026-04-26
Updated: 2026-04-26
Tags: 统计学机器学习模型评估

过拟合

概述

过拟合是指模型在训练数据上表现优异但在新数据上表现较差的现象,即模型过度学习了训练数据中的噪声和细节,导致泛化能力下降。

关键内容

  1. 现象定义:过拟合发生时,模型对训练数据拟合得近乎完美(低偏差),但对测试数据或新数据的预测效果很差(高方差)。极端情况下,参数数量等于数据点数量的模型可以完美拟合每个观测值,但毫无预测价值。

  2. 产生原因:模型过于复杂(参数过多)、训练数据不足、模型学习了数据中的噪声而非真实规律、训练时间过长等。

  3. 识别方法:训练误差远小于测试误差、学习曲线显示验证误差开始上升而训练误差持续下降、通过可视化观察模型行为等。

  4. 预防措施:使用正则化(L1/L2正则化)、增加训练数据、减少模型复杂度、使用交叉验证、提前停止训练、集成方法(如随机森林、梯度提升)等。

  5. 模型选择中的重要性:AIC等信息准则通过在似然值基础上加入复杂度惩罚项,有效防止过拟合。AIC的第一项-2ln(L)衡量拟合度,第二项2k作为复杂度惩罚,防止模型过度拟合数据。

来源

相关