从 MHA / Causal / GQA,到 Attention Sink 与 Gated Attention,理解注意力机制的设计、缺陷与演进
Attention 是 Transformer 的核心。本系列从最基础的 Self-Attention 出发,先讲清 MHA、Causal Attention、GQA 这三个工程上必须掌握的形态;然后揭开一个所有现代 softmax-based LLM 都共有的反直觉现象 Attention Sink:第一个 token 为什么会吸走绝大部分注意力,这一现象的机制、代价与消除路径;最后进入 Gated Attention,Qwen 团队 2025 年提出、用一个 head-wise sigmoid 门同时治理 sink、低秩塌缩与训练稳定性的架构改动。
读完本系列,你应该能回答:
MHA、Causal Attention、GQA / MQA 的原理、实现与权衡
第一个 token 为什么吸走绝大部分注意力,这一现象的机制、代价,以及为何消除它要留到 Gated Attention