Type: concept
Confidence: 0.95
Created: 2026-04-16
Updated: 2026-04-25
Tags: 概率论深度学习时间序列

反向传播(Backpropagation)

概述

Rumelhart、Hinton 和 Williams 于 1986 年在 Nature 发表论文,系统展示了反向传播算法如何通过链式法则将输出误差逆向传播到隐藏层,使多层神经网络能够自动学习有用的内部表示,解决了困扰 AI 领域十余年的"信用分配问题"。该算法是现代深度学习的基石。

关键内容

  1. 历史背景:1969 年 Minsky-Papert感知器》证明单层感知器无法解决 XOR 问题,导致神经网络研究陷入"AI 寒冬"。出路是添加隐藏层,但如何训练隐藏层成为核心难题。

  2. 信用分配问题:当系统整体犯错时,如何将责任分配给每个组件?输出层误差可直接计算,但隐藏层没有"期望输出"可供参考。

  3. 核心算法:通过链式法则逐层计算复合函数导数,将误差从输出层逆向传播到每个隐藏层神经元,实现梯度下降优化。具体来说,对于第l层权重W^(l),梯度为:∂L/∂W^(l) = ∂L/∂ŷ · ∂ŷ/∂h^(l+1) · ... · ∂h^(l+1)/∂h^l · ∂h^l/∂W^l。

  4. 1986年突破Learning Representations by Back-propagating Errors (1986 论文)中,Rumelhart、Hinton和Williams不仅给出了完整的数学推导,还通过XOR问题家族关系学习实验展示了算法的有效性,证明了网络能够自动学习有意义的内部表示。

  5. 算法步骤:1)前向传播:输入数据通过网络得到预测输出;2)计算损失:比较预测值与真实标签;3)反向传播:使用链式法则计算各层梯度;4)参数更新:梯度下降更新权重。

  6. 实验验证:论文中的两个关键实验包括:XOR问题的解决,证明了多层网络能处理非线性可分问题;家族关系学习实验,展示了网络自动学习抽象概念的能力。

  7. 历史优先权:Werbos(1974 博士论文)最早提出,Linnainmaa(1970)描述自动微分反向模式,Parker(1985)独立再发现。但 Rumelhart 等人的论文通过令人信服的实验展示了隐藏层自动学习有意义内部表示的能力。

  8. 范式意义:标志着连接主义对符号主义的强势回归,证明了多层网络的理论和实践可行性。

来源

相关