从 Self-Attention 出发,依次拆开 Multi-Head、Causal Masking 与 GQA / MQA 的设计权衡
Attention(注意力机制)是现代深度学习中最重要的创新之一,它使模型能够在处理序列数据时动态地关注不同位置的信息。
在 Transformer 架构中,Attention 机制的核心思想是:让每个位置的 token 根据其与其他 token 的相关性,对它们进行加权求和。
给定输入序列,Self-Attention 通过以下步骤计算输出:
𝑋 𝑊 𝑉 Q=XW Q
,K=XW K
,V=XW V
𝑄 𝐾 𝑇 𝐷 S= D
QK T
其中 𝐷 D 是 head dimension,除以 𝐷 D
用于数值稳定性(scaled dot-product) 3. 应用 Softmax:将分数转换为概率分布
softmax ( 𝑆 ) A=softmax(S) 4. 加权求和:用注意力权重对 Value 进行加权
𝐴 𝑉 O=AV
直观理解: