Type: concept
Confidence: 0.90
Created: 2026-04-16
Updated: 2026-04-16
Tags: 深度学习Transformer注意力机制NLPLLM能力

多头注意力

概述

多头注意力Multi-Head Attention)在 h 个独立子空间中并行执行 Self-Attention机制,再拼接并线性变换,使模型同时捕获不同类型的语义关系,是 Transformer架构 的标准注意力形式。

关键内容

核心公式

$$\text{MultiHead}(Q,K,V)=\text{Concat}(head_1,\dots,head_h)W_O$$

每个 head 独立执行缩放点积注意力

$$head_i = \text{Attention}(QW_Q^i, KW_K^i, VW_V^i)$$

每个 head 的投影维度通常为 $d_k = d_{model}/h$,保持总计算量与单头相当。

为什么需要多头

单头注意力在单一表示子空间内学习关系。多头机制让模型在不同子空间里同时学习:

不同 head 自动分工,捕获互补的上下文信息。

计算复杂度

多头注意力的总复杂度与单头相同(子空间维度缩小 h 倍,但有 h 个 head):

来源

相关