Type: entity
Confidence: 0.90
Created: 2026-04-25
Updated: 2026-04-25
Tags: nlparchitectureattentiongoogledeep-learning机器学习

Transformer

概述

一种完全基于注意力机制的深度学习架构,由Google Brain团队在2017年的论文《Attention Is All You Need》中首次提出。该架构抛弃了传统的循环和卷积结构,实现了完全并行化的序列处理。

关键内容

核心组件

  1. 自注意力机制:使模型能够关注输入序列中的任意位置,捕获长距离依赖关系
  2. 多头注意力:允许模型从不同的表示子空间同时关注不同类型的信息
  3. 位置编码:为模型提供序列位置信息,因为注意力机制本身是位置无关的
  4. 前馈网络:独立地对每个位置应用相同的线性变换
  5. 残差连接层归一化:提升深层网络的训练稳定性

架构设计

Transformer包含编码器(Encoder)和解码器(Decoder)两个部分,每个部分都由多个相同的层堆叠而成。编码器由6个相同的层组成,每层有两个子层:多头自注意力机制和位置全连接前馈网络。解码器同样由6个层组成,但在两个子层之间增加了第三个子层,用于处理编码器的输出。

优势

影响

Transformer架构奠定了现代大语言模型的基础,BERT、GPT等模型均基于此架构或其变体。此外,该架构还成功扩展到了计算机视觉等领域,产生了Vision Transformer等重要模型。

来源

相关