从 MHA / Causal / GQA,到 Attention Sink 与 Gated Attention,理解注意力机制的设计、缺陷与演进

概述

Attention 是 Transformer 的核心。本系列从最基础的 Self-Attention 出发,先讲清 MHA、Causal Attention、GQA 这三个工程上必须掌握的形态;然后揭开一个所有现代 softmax-based LLM 都共有的反直觉现象 Attention Sink:第一个 token 为什么会吸走绝大部分注意力,这一现象的机制、代价与消除路径;最后进入 Gated Attention,Qwen 团队 2025 年提出、用一个 head-wise sigmoid 门同时治理 sink、低秩塌缩与训练稳定性的架构改动。

读完本系列,你应该能回答:

章节内容

Self-Attention 到 GQA

Self-Attention 到 GQA

MHA、Causal Attention、GQA / MQA 的原理、实现与权衡

Attention Sink

Attention Sink

第一个 token 为什么吸走绝大部分注意力,这一现象的机制、代价,以及为何消除它要留到 Gated Attention

参考资料