Transformer
概述
一种完全基于注意力机制的深度学习架构,由Google Brain团队在2017年的论文《Attention Is All You Need》中首次提出。该架构抛弃了传统的循环和卷积结构,实现了完全并行化的序列处理。
关键内容
核心组件
- 自注意力机制:使模型能够关注输入序列中的任意位置,捕获长距离依赖关系
- 多头注意力:允许模型从不同的表示子空间同时关注不同类型的信息
- 位置编码:为模型提供序列位置信息,因为注意力机制本身是位置无关的
- 前馈网络:独立地对每个位置应用相同的线性变换
- 残差连接与层归一化:提升深层网络的训练稳定性
架构设计
Transformer包含编码器(Encoder)和解码器(Decoder)两个部分,每个部分都由多个相同的层堆叠而成。编码器由6个相同的层组成,每层有两个子层:多头自注意力机制和位置全连接前馈网络。解码器同样由6个层组成,但在两个子层之间增加了第三个子层,用于处理编码器的输出。
优势
- 完全并行化:相比RNN的串行计算,Transformer可以并行处理序列中的所有位置,大大提高了训练效率
- 长距离依赖:通过自注意力机制直接连接任意两个位置,更好地捕获长距离依赖关系
- 可解释性:注意力权重提供了模型决策过程的可视化
影响
Transformer架构奠定了现代大语言模型的基础,BERT、GPT等模型均基于此架构或其变体。此外,该架构还成功扩展到了计算机视觉等领域,产生了Vision Transformer等重要模型。
来源
- Attention Is All You Need — 原始论文
相关
- Attention Is All You Need — 提出论文
- Self-Attention — 核心技术
- BERT — 基于此架构
- GPT — 基于此架构
- Vision Transformer — 扩展应用
- RNN — 替代的技术