☆ 保存 Multi-Head Attention — 为什么多个注意力头能丰富上下文表示
05/23/2026
Multi-Head Attention,即多头注意力机制,是 Transformer 中最重要的结构之一。它将一次 attention 拆分为多个注意力头(head),让模型能够在不同的表示空间(Representation Space)中并行学习词语之间的关系。这样做可以缓解单一 attention 只能依赖一种相似度标准的结构性限制,使模型更充分地捕捉语法、语义与位置关系。
**直观地说:**如果只用一台摄像机拍摄同一个场景,留下的只是单一视角。但如果同时使用广角镜头、长焦镜头、红外镜头等不同设备,就能从位置、形状、运动和细节等多个角度观察同一画面。Multi-Head Attention 也是类似的机制:多个注意力头从不同角度解读同一输入,再将结果整合,形成更细腻、更稳定的上下文表示。
多个注意力头在不同表示空间中理解同一输入,最终整合为统一的上下文表示。
工作方式(原理与特点)
-
单一 Attention 的局限
- 一般的 attention 会根据 Query 与 Key 的相似度,决定应该参考哪些 token,以及参考到什么程度。
- 但如果只有一个 attention,所有关系都必须被压缩到同一种相似度标准中。
- 一句话中往往同时存在主谓关系、修饰关系、语义相似性、位置信息等多种关系。
- Multi-Head Attention 不把这些复杂关系交给单一标准处理,而是分配给多个注意力头并行学习。
-
表示空间的划分
- 每个注意力头在生成 Query、Key、Value 时,都会使用不同的 projection matrix。
- 因此,即使是同一个词,也会在不同 head 中被投影到不同的特征空间。
- 某个 head 可能更关注相邻词之间的关系,另一个 head 则可能更关注语义上相关的词。
- 这种结构相当于把输入表示拆分到多个 subspace 中分别解释。
-
\[ \text{head}_i = \text{Attention}(QW_i^Q, KW_i^K, VW_i^V) \]
\[ \text{MultiHead}(Q·K·V) = \text{Concat}(\text{head}_1,\dots,\text{head}_h)W^O \]
Q、K、V 分别表示 Query、Key、Value,W 是各个 head 使用的 projection matrix。不同的 W 让各个注意力头以不同方式观察输入;各 head 的结果先通过 concat 保留下来,再由 WO 重新整合。
-
不同 Head 的关系学习
- 由于每个 head 都使用独立的 projection,它们有机会学习到不同的 attention pattern。
- 例如,某个 head 可能主要关注句子中的相邻 token,另一个 head 则可能关注距离较远但语义关键的词。
- 不过,并不是所有 head 都会自然分化出完全不同的功能。
- 实际训练中,部分 head 可能学习到相似模式,这会带来 head redundancy 问题。
-
Concat 与输出整合
- 如果直接对多个 head 的输出求平均,不同视角中的细节信息可能会被削弱。
- Concat 会将各个 head 的信息并排保留下来。
- 随后,输出 projection 会重新混合这些信息,生成最终的上下文表示。
- 因此,Multi-Head Attention 可以理解为一种“分开观察、保留差异、再重新组合”的结构。
-
直观示例
- 来看句子 “The bank raised interest rates”。
- 某个 head 可能重点判断 “bank” 在这里表示金融机构。
- 另一个 head 可能更强地连接 “raised” 与 “rates” 之间的动作关系。
- 还有 head 可能利用词序或距离信息补充句子结构。
- 这些不同关系被组合起来后,就能形成比单一 attention 更丰富的上下文表示。
意义与局限
Multi-Head Attention 是 Transformer 能够并行学习复杂上下文关系的关键结构。它不是把所有关系都压缩进同一个 attention 标准,而是在多个表示空间中分别建模,再重新整合,从而提升上下文表示的表达能力。这缓解了单一 attention 过度依赖单一关系标准的结构性限制。不过,head 数量增加并不必然带来性能提升。更多 head 会增加计算成本和显存占用,也可能出现部分 head 学习重复模式的 redundancy。因此在实际模型设计中,真正重要的不只是 head 数量,还包括模型规模、数据规模、训练稳定性,以及不同 head 之间是否形成有效的功能分化。
建议先读 (3/5)
+2
- 5.7 用于优化CNN训练的数据处理与归一化技术
- GELU(高斯误差线性单元)— 用“概率式”通过率实现平滑非线性的激活函数
- Position-wise Feed Forward Network — Transformer 中在每个位置上相同应用的非线性变换层
- Content-based Addressing(基于内容的寻址)——通过语义相似度访问 Memory 的原理
- Differentiable Addressing(可微寻址)——利用连续权重选择记忆位置的原理
接下来推荐阅读 (5/19)
+5
- 7.8 Transformer模型中的高级位置编码——APE、RPE与RoPE
- 7.3 自注意力机制 — 从 Query–Key–Value 到矩阵计算
- Head Redundancy(注意力头冗余)— 为什么多个 Attention Head 会关注相同的信息
- Scaled Dot-Product Attention — 为什么除以 √dₖ 能让 Attention 更稳定
- Transformer Attention Projection — QKV 分离与 Attention 的计算原理
- Unified Representation — 为什么 Attention 会同时比较语义与位置信息
- Sparse Attention — 为什么只计算部分 Token 也能保持上下文理解能力
- Weighted Sum of Value Vectors — Attention 为什么要对 Value 做加权求和
- Position Interpolation — 为什么 RoPE 在长上下文中会失去位置感知能力
- Token-wise Normalization — 为什么它是 Transformer 训练稳定性的关键
- Global Token:Transformer 如何将完整输入汇聚成一个全局表示
- Location-based Addressing——基于位置访问 Memory 的工作机制
- Weight Tying — 为什么要共享理解单词与生成单词的表示空间
- 8. Generative Modeling — 生成建模与 Deep Generative Model 的核心原理
- Latent Bottleneck — 为什么模型要让信息通过狭窄的潜在空间
- Permutation Equivariance(置换等变性)——为什么输入顺序变化后输出也会同步变化
- Distance-based Inductive Bias — 为什么模型会优先连接邻近信息
- Permutation Invariance — 为什么输入顺序改变,模型仍能得到相同结果
- Permutation-Equivariant — 为什么改变输入顺序后输出也会保持对应变化
同一主题文章 (3/3)
- SiLU Activation — 为什么它是一种比 ReLU 更具表达能力的非单调 Gating Function
- Swish Activation — 为什么它能够缓解 ReLU 的 gradient 断裂问题
- Projection Layer — 将 hidden representation 转换为 output space 的核心机制
相关概念 (8/9)
+1
- Channel Attention — 通过通道重要性增强特征表示的机制
- RMSNorm(Root Mean Square Normalization)— 为什么在 Transformer 和 LLM 中比 LayerNorm 更高效
- Cross-Modal Interaction — 学习不同模态之间关系的核心机制
- Voice Encoder — 将语音信号转换为可比较嵌入表示的核心原理
- Feature Alignment——按语义统一不同的表示空间
- Spatial Alignment——让不同空间表示对齐到同一坐标基准
- Complementary Information — 不同信息如何共同补充语义的核心原理
- Normalizing Flow(归一化流)——通过可逆变换学习概率密度的生成模型
📍 这个概念在 AI 学习地图中的位置
查看这个概念在整个 AI Universe 中的位置。
📍 AI Universe 中的当前位置
☰
重置 显示已完成 · 需要登录 加载中…
🌌 AI Universe
‹
›
⭐ 概念
请选择一个节点。
« MHA Output Projection Ma…|多跳推理(Multi-hop Reasoning… »
🔖 标签: Attention机制 · Transformer · 上下文表示 · 多头注意力机制 · 大语言模型 · 深度学习