cookllm-bento 训练框架介绍
👨🍳
我们正在为您精心准备高质量内容,敬请期待!
多维混合并行
ParallelContext 坐标系统与 TP+DP+PP 的工业级组合
从样本数据开始,完成 29M BentoLM 的完整预训练闭环
预训练是 cookllm-bento 的第一条主线。这里从一个 29M 参数的小模型开始,完整走过语言模型预训练需要的关键环节:准备文本数据,训练 tokenizer,定义 BentoLM,构建数据流水线,进入 Lightning 训练循环,写出 checkpoint、TensorBoard/SwanLab 日志和采样文本。
这一章会从训练前的数据和 tokenizer 开始,逐步进入模型架构、数据流水线、训练循环和监控验证。完成后,你应该知道一条预训练任务由哪些文件组成,每个配置文件管什么,以及当训练速度、loss、采样输出或 checkpoint 出问题时应该从哪里开始查。
这一章关注 cookllm-bento 中“如何跑”。如果你想深入理解 Attention、RoPE、RMSNorm、激活函数或优化器原理,可以配合阅读”原理精讲”中的对应章节。
理解 Fineweb-Edu-Chinese 数据、采样 shard、默认目录和下载入口
使用 RustBPE 训练 BPE tokenizer,并导出 tiktoken 编码
从 bento_29m.yaml 读懂 BentoLM 的规模、模块和现代 Transformer 技巧