Type: concept
Confidence: 0.85
Created: 2026-04-16
Updated: 2026-04-16
Tags: 深度学习Transformer网络结构训练稳定性LLM能力

残差连接

概述

将子层输入直接加到子层输出上:$x + \text{Sublayer}(x)$,缓解深层网络梯度消失问题,是 Transformer 每层的基础结构之一。

关键内容

  1. 基本形式:$\text{output} = x + \text{Sublayer}(x)$,子层可以是 Self-AttentionFeed-Forward Network,原始输入通过跳跃路径直接传递到后续层

  2. 作用:允许梯度直接回传,缓解深层网络梯度消失;让网络学习"残差"(增量)而非完整映射,更易优化;Transformer 中每个子层(Attention、FFN)都使用残差连接

  3. 与归一化的配合:残差路径将原始输入与子层输出相加,若两者数值尺度差异大会导致不稳定,因此需要 Layer Normalization 来控制数值范围。Pre-LN 和 Post-LN 两种方案均在残差结构基础上放置 LayerNorm

来源

相关