Transformer
概述
Transformer是一种完全基于注意力机制的深度学习架构,由Google Brain于2017年在论文《Attention Is All You Need》中提出。该架构抛弃了传统的循环和卷积结构,实现了完全并行化处理,成为现代AI模型的基础架构。
关键内容
- 整体架构:
- 编码器-解码器结构,各含N个相同的层(原论文中N=6)
- 编码器负责将输入序列转换为连续表示
-
解码器逐步生成输出序列
-
编码器组件:
- 多头自注意力机制:捕获输入序列内部的依赖关系
- 前馈神经网络:对每个位置独立进行相同变换
-
解码器组件:
- 掩蔽多头自注意力:防止关注未来信息
- 多头注意力层:关注编码器输出
- 前馈神经网络:逐位置变换
-
线性层与Softmax:输出概率分布
-
关键技术:
- 位置编码解决序列顺序问题
- 注意力机制实现长距离依赖
- 并行化训练大幅提升效率
来源
- Attention Is All You Need — 原始论文
- paper_06_transformer.md — 论文精读笔记
- raw/articles/ai-papers/foundations/paper_06_transformer.md — 原始资料
相关
- Attention Is All You Need — described_in
- Self-Attention — utilizes
- Multi-Head Attention — utilizes
- Positional Encoding — utilizes
- Feed Forward Network — utilizes
- Layer Normalization — utilizes
- Residual Connection — utilizes
- Google Brain — developed_by
- BERT — predecessor
- GPT — predecessor
- RNN — supersedes