Type: concept
Confidence: 0.90
Created: 2026-04-18
Updated: 2026-04-18
Tags: 机器学习深度学习神经网络

多层感知机

概述 (50-200字符)

多层感知机(MLP)是包含输入层、一个或多个隐藏层和输出层的前馈神经网络。通过反向传播算法训练,MLP 能够解决单层感知机无法处理的非线性问题(如XOR问题),是现代深度学习的基础架构。

关键内容 (≥300字符, 用双链)

  1. 架构:MLP 由多层全连接层堆叠而成,每层执行 h = σ(W·x + b) 的线性变换加非线性激活。隐藏层的引入使网络能够学习数据的层次化表示(representations),这也是 Rumelhart 论文标题"Learning Representations"的含义。
  2. 为什么需要多层:单层感知机只能学习线性可分的决策边界。1969 年 Minsky 指出感知机无法解决 XOR 问题(异或运算),导致神经网络研究沉寂十余年。MLP 通过隐藏层引入非线性变换能力,可以拟合任意复杂函数(通用近似定理)。
  3. 训练方法:MLP 的训练依赖反向传播算法。输出层的误差可直接观察,但隐藏层的权重更新需要将误差沿计算图逆向传播,用链式法则计算每个权重对误差的贡献。1986 年 Rumelhart 等人的论文给出了完整解答。
  4. 现代演进:虽然 MLP 是最基础的网络形式,但现代深度学习架构(CNN、RNN、Transformer)本质上都是 MLP 的变体——引入特定归纳偏置(如卷积的局部性、注意力机制的全局依赖)以提升效率和性能。

来源

相关