Type: concept
Confidence: 0.85
Created: 2026-04-16
Updated: 2026-04-16
Tags: 深度学习NLP大模型序列建模LLM能力

Transformer架构

概述

Transformer 是 2017 年提出的序列到序列神经网络架构,以 Self-Attention机制 替代 RNN 的顺序传播,实现完全并行的全局上下文建模,成为现代大语言模型的基础架构。

关键内容

核心设计思想

Transformer 的关键创新是用 Self-Attention机制 取代 RNN 的循环结构:

核心模块: 1. 多头注意力Multi-Head Attention:并行多子空间注意力 2. 前馈网络(FFN):逐位置的非线性变换 3. 层归一化LayerNorm:稳定训练 4. 残差连接:缓解梯度消失

计算瓶颈

Self-Attention注意力矩阵大小为 $n \times n$(n 为序列长度),导致:

这是 Transformer 处理超长序列的主要障碍,也是 注意力预算 概念的架构根因。各类改进(Sparse Attention、Flash Attention、线性注意力)均以降低此复杂度为目标。

与 RNN/CNN 的比较

| | RNN | CNN | Transformer | |--|-----|-----|-------------| | 并行度 | 低(顺序) | 高(局部) | 高(全局) | | 长距依赖 | 弱 | 弱 | 强 | | 序列复杂度 | $O(n)$ | $O(n)$ | $O(n^2)$ | | 适用场景 | 流式、短序列 | 局部模式 | 全局上下文建模 |

来源

相关