Type: concept
Confidence: 0.95
Created: 2026-04-18
Updated: 2026-04-25
Tags: 机器学习深度学习正则化神经网络

Dropout

概述 (50-200字符)

Dropout 是一种神经网络正则化技术,训练时以概率 p 随机关闭神经元,防止过拟合。2012 年 AlexNet 使用 p=0.5 显著降低验证集错误率,成为深度学习标准组件。2014年Nitish Srivastava等人在JMLR论文中正式提出该方法并提供了理论基础。

关键内容 (≥300字符, 用双链)

  1. 机制与实现:训练阶段,每个神经元以概率 p(通常 0.5)被随机"关闭"(输出置零)。这强迫网络学习冗余、独立的特征表示,而不是依赖特定神经元的协同作用。现代实现常采用 Inverted Dropout:训练时进行缩放以避免测试时修改权重。相当于同时训练 2^N 个共享参数的子网络,是一种高效的模型集成方法。
  2. 数学形式化:训练时前向传播中的 Dropout 可形式化为:$\tilde{r}j^{(l)} \sim \text{Bernoulli}(1-p)$,$\tilde{y}^{(l)} = \tilde{r}^{(l)} \odot y^{(l)}$。测试时权重乘以 $(1-p)$ 进行期望补偿:$w{test} = w_{train} \times (1 - p)$。
  3. 理论解释:Dropout 的有效性可从三个角度理解:(a) 隐式集成学习(Ensemble Learning)视角——训练 2^n 个子网络的几何平均;(b) 打破神经元共适应——强迫神经元独立有意义;(c) 贝叶斯近似——可解释为对权重的变分贝叶斯近似。
  4. 应用与最佳实践:通常在全连接层使用 0.5 丢弃率,在卷积层使用 0.1-0.3 丢弃率,输出层一般不用。需注意测试时切换 model.eval() 模式。Dropout: A Simple Way to Prevent Neural Networks from Overfitting (2014 论文) 中详细验证了其在 MNIST、CIFAR-10ImageNet 等多个基准上的有效性。

来源

相关