Type: concept
Confidence: 0.85
Created: 2026-04-18
Updated: 2026-04-18
Tags: 深度学习注意力机制NLP机器翻译机器学习

Luong注意力

概述

Luong 点积/乘性注意力以 $s^\top W h$ 替代 Bahdanau 的加性函数,参数更少、速度更快,是 缩放点积注意力 的直接前身。

关键内容

三种变体

类型 对齐函数 特点
Dot(点积) $s^\top h$ 无额外参数,最快
General(乘性) $s^\top W h$ 折中方案,一个矩阵
Concat(拼接) $v^\top \tanh(W[s; h])$ 与 Bahdanau 类似

与 Bahdanau 的核心差异

  1. 计算时机:Bahdanau 在 Decoder 输入前计算注意力;Luong 在 Decoder 状态更新后计算
  2. 维度约束:Luong 要求编码器与解码器隐藏维度相同;Bahdanau 无此限制
  3. 效率:Luong 点积变体无需额外前馈网络,速度显著快于 Bahdanau

演化意义

Luong 注意力缩放点积注意力 的直接前身。Vaswani 等人在 Transformer 中采用的 $QK^\top / \sqrt{d}$ 正是 Luong 点积注意力的缩放版本,去除了 $W$ 矩阵并加入维度归一化以防止高维点积过大。

来源

相关