隐式集成
概述
Dropout 的第一种理论解释:训练时随机丢弃神经元等价于同时训练指数级数量的子网络并在推理时进行集成。
关键内容
- 指数级子网络:对于一个有 n 个神经元的层,Dropout 每次前向传播随机选择一部分神经元激活,共有 2^n 种可能的子网络配置。训练过程近似同时训练了所有这些子网络。
- 权重共享集成:与传统 Bagging 训练独立模型不同,Dropout 的子网络共享参数。这种权重共享使得隐式集成在计算和内存上极其高效,同时保留了集成学习的泛化优势。
- 与显式集成的对比:显式集成需要训练和存储多个独立模型,推理时需要运行所有模型并平均输出。Dropout 的隐式集成只需一个模型,训练时随机采样子网络,推理时使用全部神经元(近似所有子网络的几何平均)。
隐式集成是 Dropout 的核心理论解释之一,揭示了 Dropout 为何具有强大的正则化效果。
来源
相关
- Dropout(随机失活) — explains
- Bagging(自举聚合) — compares_to
- Inverted Dropout — relates_to
- 过拟合(Overfitting) — solves