从 Self-Attention 出发,依次拆开 Multi-Head、Causal Masking 与 GQA / MQA 的设计权衡

什么是 Attention 机制

Attention(注意力机制)是现代深度学习中最重要的创新之一,它使模型能够在处理序列数据时动态地关注不同位置的信息。

在 Transformer 架构中,Attention 机制的核心思想是:让每个位置的 token 根据其与其他 token 的相关性,对它们进行加权求和

标准 Self-Attention 计算流程

给定输入序列,Self-Attention 通过以下步骤计算输出:

  1. 线性变换:将输入 𝑋 X 分别投影为 Query ( 𝑄 Q)、Key ( 𝐾 K)、Value ( 𝑉

𝑄

𝑋 𝑊 𝑄 , 𝐾

𝑋 𝑊 𝐾 , 𝑉

𝑋 𝑊 𝑉 Q=XW Q

,K=XW K

,V=XW V

  1. 计算注意力分数:通过 Query 和 Key 的点积计算相似度

𝑆

𝑄 𝐾 𝑇 𝐷 S= D

QK T

其中 𝐷 D 是 head dimension,除以 𝐷 D

用于数值稳定性(scaled dot-product) 3. 应用 Softmax:将分数转换为概率分布

𝐴

softmax ( 𝑆 ) A=softmax(S) 4. 加权求和:用注意力权重对 Value 进行加权

𝑂

𝐴 𝑉 O=AV

直观理解