门控机制
概述
门控机制是深度学习中的一种架构设计模式,通过控制信息流的开关来决定网络中哪些信息应该保留、哪些应该丢弃、哪些应该输出。
关键内容
- 核心思想:
- 门控机制通过sigmoid神经网络层产生0到1之间的数值
- 这些数值决定了让多少信息通过特定的"门"
-
实现了选择性记忆、选择性遗忘、选择性输出的功能
-
在LSTM中的实现:
- 输入门(Input Gate):控制当前时刻有多少新信息可以流入记忆细胞
- 遗忘门(Forget Gate):控制记忆细胞中有多少旧信息需要被丢弃
-
输出门(Output Gate):控制记忆细胞中的信息有多少可以输出到网络的其他部分
-
历史意义:
- 1997年由Hochreiter和Schmidhuber在LSTM中首次提出
- 开创了门控网络的范式,深刻影响了后续所有序列建模架构
-
包括GRU和Transformer中的门控线性单元都受其启发
-
应用场景:
- LSTM:通过三道闸门协同工作,解决梯度消失问题
- GRU:将LSTM的三个门简化为两个门(重置门和更新门)
- 现代神经网络架构中的各种控制机制都受到门控思想的影响
来源
- 12-hochreiter-1997-lstm.md — 门控机制起源
相关
- LSTM — implemented_in
- 输入门(Input Gate) — includes
- 遗忘门(Forget Gate) — includes
- 输出门(Output Gate) — includes
- GRU — implemented_in
- 选择性记忆 — enables