Self-Attention
概述
一种注意力机制,允许序列中的每个位置关注序列中的所有位置,从而建立序列内部的全局依赖关系,是 Transformer 架构的核心组件。
关键内容
- 工作机制:
- 查询(Q)、键(K)、值(V)的计算
- 注意力分数的计算:通过 QK^T 得到注意力分数矩阵
- 使用 softmax 函数将分数转化为概率分布
-
对值向量进行加权求和
-
技术特点:
- 在序列中任意两个位置之间建立常数级别的路径长度
- 使模型能够动态决定应该关注哪些位置的信息
-
支持并行计算,提高了训练效率
-
应用价值:
- 解决了 RNN 在处理长距离依赖时的梯度消失问题
- 提供了捕捉长距离依赖关系的有效手段
- 是 Transformer 模型能够高效处理序列数据的关键
来源
- Transformer — 核心组件
- 20-vaswani-transformer.md — raw/books/计算机科学/20-vaswani-transformer.md
相关
- Transformer — core_component
- Attention Is All You Need — introduced_in
- Multi-Head Attention — related
- Scaled Dot-Product Attention — variant