实现 Flash Attention 的梯度计算,通过 Recomputation 实现内存高效的训练。

配套代码


Grouped Query Attention

实现 GQA/MQA 支持,让多个 Query Head 共享 KV,优化 KV Cache 内存占用。

分布式训练

从数据并行到多维混合并行,理解大模型训练的核心并行策略