均方误差(MSE)
概述
均方误差(Mean Squared Error)是最常用的回归损失函数,计算预测值与真实值之差的平方的平均值,衡量预测的准确性。
关键内容
- 数学定义:L = ½(ŷ - y)²(单样本)或 L = (1/n)Σ(ŷᵢ - yᵢ)²(多样本)。平方操作确保误差始终为正,且对大误差给予更大惩罚。系数 ½ 是为了求导后消去 2,使梯度形式更简洁:∂L/∂ŷ = ŷ - y。
- 在反向传播中的角色:1986 年 Rumelhart 等人的原始反向传播论文使用 MSE 作为损失函数。MSE 的导数形式简单(ŷ - y),使得输出层的误差信号可以直接计算,然后通过链式法则反向传播到隐藏层。
- 优点与局限:MSE 对异常值敏感(平方放大大误差的影响),在回归任务中表现良好。但在分类任务中,交叉熵损失通常更合适,因为它与概率解释兼容,且在预测错误时梯度更大、学习更快。
- 与梯度下降的配合:MSE 是凸函数(对于线性模型),梯度下降(Gradient Descent)可以找到全局最优。但对于非线性神经网络,损失面是非凸的,存在多个局部最优和鞍点(Saddle Point)。
来源
- paper_02_backpropagation — 损失函数(Loss Function)章节
相关
- 反向传播 — used_in
- 梯度下降(Gradient Descent) — optimized_by
- 交叉熵 — compares_to
- 梯度消失 — relates_to