相对位置编码
概述
相对位置编码关注两个 token 之间相隔多远,而非各自处于第几位。位置信息直接注入注意力分数计算,使模型在决定"该关注谁"时显式考虑相对距离 $i-j$。
关键内容
- 核心思想:注意力分数被建模为 $\text{AttentionScore}_{ij}=f(q_i,k_j,i-j)$,相对距离 $i-j$ 作为独立输入参与计算,而非简单加到 embedding 上。
- 优势:对序列平移更鲁棒("形容词+名词"模式无论出现在位置 2-3 还是 50-51,相对距离不变);对长序列外推更好;更适合建模局部模式和结构关系。
- 代价:实现比绝对位置编码复杂,需修改注意力计算公式,工程优化难度更高,部分方案引入额外参数或计算开销,且不一定保留全局绝对位置信息。
来源
- raw/ChatGPT-Chat/ChatGPT-Self-Attention机制解析/02-什么是位置编码?对比绝对位置编码和相对位置编码的优缺点 — ChatGPT 对话:Self-Attention 机制解析