Type: concept
Confidence: 0.90
Created: 2026-04-26
Updated: 2026-04-26
Tags: 注意力机制深度学习序列建模机器学习

Self-Attention

概述

一种注意力机制,允许序列中的每个位置关注序列中的所有位置,从而建立序列内部的全局依赖关系,是 Transformer 架构的核心组件。

关键内容

  1. 工作机制
  2. 查询(Q)、键(K)、值(V)的计算
  3. 注意力分数的计算:通过 QK^T 得到注意力分数矩阵
  4. 使用 softmax 函数将分数转化为概率分布
  5. 对值向量进行加权求和

  6. 技术特点

  7. 在序列中任意两个位置之间建立常数级别的路径长度
  8. 使模型能够动态决定应该关注哪些位置的信息
  9. 支持并行计算,提高了训练效率

  10. 应用价值

  11. 解决了 RNN 在处理长距离依赖时的梯度消失问题
  12. 提供了捕捉长距离依赖关系的有效手段
  13. Transformer 模型能够高效处理序列数据的关键

来源

相关