残差连接
概述
将子层输入直接加到子层输出上:$x + \text{Sublayer}(x)$,缓解深层网络梯度消失问题,是 Transformer 每层的基础结构之一。
关键内容
-
基本形式:$\text{output} = x + \text{Sublayer}(x)$,子层可以是 Self-Attention 或 Feed-Forward Network,原始输入通过跳跃路径直接传递到后续层
-
作用:允许梯度直接回传,缓解深层网络梯度消失;让网络学习"残差"(增量)而非完整映射,更易优化;Transformer 中每个子层(Attention、FFN)都使用残差连接
-
与归一化的配合:残差路径将原始输入与子层输出相加,若两者数值尺度差异大会导致不稳定,因此需要 Layer Normalization 来控制数值范围。Pre-LN 和 Post-LN 两种方案均在残差结构基础上放置 LayerNorm
来源
- raw/ChatGPT-Chat/ChatGPT-Self-Attention机制解析 — Self-Attention 机制解析系列 QA
相关
- Layer Normalization — relates_to(配合控制数值尺度)
- Batch Normalization — relates_to