自注意力蒸馏
概述
Informer模型中用于解决多层编码器堆叠导致内存瓶颈的技术,通过逐层减半序列长度来降低内存占用。
关键内容
- 问题背景:
- 标准Transformer通过堆叠多层编码器提取层次化特征
- 每层需保存完整注意力矩阵,J层编码器总内存开销为O(J * L^2)
-
序列长度达数千步时,高端GPU也难以容纳
-
蒸馏机制:
- 在每一层编码器后使用一维卷积和最大池化操作
- 将序列长度逐层减半(第j层输出L_j,传入j+1层为L_j/2)
-
经J层后序列长度从L缩减至L/2^J
-
信息论视角:
- 逐层提炼过程:底层捕捉局部细节,高层聚焦全局模式
- 通过逐步压缩丢弃冗余信息,保留最本质的时序特征
- 实现内存高效与特征保留的平衡
来源
- 15-informer-2021-transformer-time-series — Informer: 当 Transformer 叩开时间序列预测的大门
- [[]] —
相关
- Informer — part_of
- 生成式解码器 — relates_to
- ProbSparse自注意力 — relates_to
- 时间序列预测 — relates_to