内部协变量偏移
概述
神经网络训练过程中,随着前面层权重更新,每一层看到的输入分布不断变化,导致后续层需要持续适应新分布,大幅减慢训练速度。
关键内容
- 定义与类比:外部协变量偏移指训练集和测试集分布不同;内部协变量偏移则是网络内部各层之间的分布漂移。类比:教学生做加法但每题后改变教材字体和符号系统,学生需不断重新适应。
- BatchNorm 的解决方案:通过将每层输入标准化为统一分布(均值 0、方差 1),消除分布漂移,使各层用统一的"语言"交流。配合可学习参数 γ 和 β 保留表达灵活性。
- 理论争议:后续研究(2018 年 MIT 论文)表明 BatchNorm 并未显著减少内部协变量偏移,其真正有效原因是使优化景观(loss landscape)更加平滑,梯度方向更稳定。
来源
- raw/articles/ai-papers/foundations/paper_04_batchnorm.md — 论文精读 #04:批归一化
相关
- Batch Normalization — solved_by(BN 论文提出的解决方案)
- 梯度消失 — relates_to(分布漂移加剧梯度消失问题)
- 损失景观平滑化 — relates_to(后续研究认为 BN 的真正作用机制)