注意力机制
概述
注意力机制是一种深度学习技术,允许神经网络在处理序列数据时"回头看"输入序列的相关部分,从而更好地建模长距离依赖关系。
关键内容
- 核心思想:
- 允许解码器在生成每个输出时,"回头看"输入序列的所有位置
- 通过学习输入序列各部分的重要性权重来实现选择性关注
-
极大地增强了长距离依赖的捕捉能力
-
历史发展:
- 2014年由Bahdanau等人首次提出用于神经机器翻译
- 解决了编码器-解码器架构在处理长序列时的局限性
-
成为连接LSTM时代和Transformer时代的桥梁
-
与LSTM的关系:
- 即使有了LSTM,编码器-解码器架构在处理长序列时仍然力不从心
- 注意力机制是对LSTM能力的有力补充
-
为后续的Transformer架构奠定了基础
-
技术意义:
- 提供了一种新的建模序列关系的方法
- 是从RNN/LSTM到Transformer架构演化的关键环节
- 在2017年Transformer架构中得到了更加纯粹的应用
来源
- 12-hochreiter-1997-lstm.md — 注意力机制发展历程
相关
- LSTM — enhances
- Bahdanau Dzmitry — introduced_by
- Encoder-Decoder架构 — improves
- Transformer — predecessor_to
- 机器翻译 — applied_in