绝对位置编码
概述
绝对位置编码直接告知模型当前 token 处于第几个位置。分固定式(正弦/余弦公式)和可学习式两种,是原始 Transformer、BERT、ViT 等模型的标准做法。
关键内容
- 固定式(Sinusoidal):用正弦/余弦公式生成,无需训练参数,理论上可外推到更长序列:$PE(pos,2i)=\sin(pos/10000^{2i/d})$,$PE(pos,2i+1)=\cos(pos/10000^{2i/d})$。
- 可学习式:给每个位置分配可训练向量 $p_1,\ldots,p_n$,BERT 和 ViT 等预训练模型采用此方案,工程成熟、训练稳定,但长度外推能力弱。
- 优缺点:实现简单、训练稳定、对中短序列效果良好;但对序列平移不鲁棒,不擅长直接建模 token 间相对距离,可学习式对长度外推尤其脆弱。
来源
- raw/ChatGPT-Chat/ChatGPT-Self-Attention机制解析/02-什么是位置编码?对比绝对位置编码和相对位置编码的优缺点 — ChatGPT 对话:Self-Attention 机制解析