cookllm-bento 训练框架介绍

👨‍🍳

内容正在烹饪中…

我们正在为您精心准备高质量内容,敬请期待!

多维混合并行

ParallelContext 坐标系统与 TP+DP+PP 的工业级组合

预训练

从样本数据开始,完成 29M BentoLM 的完整预训练闭环

概述

预训练是 cookllm-bento 的第一条主线。这里从一个 29M 参数的小模型开始,完整走过语言模型预训练需要的关键环节:准备文本数据,训练 tokenizer,定义 BentoLM,构建数据流水线,进入 Lightning 训练循环,写出 checkpoint、TensorBoard/SwanLab 日志和采样文本。

这一章会从训练前的数据和 tokenizer 开始,逐步进入模型架构、数据流水线、训练循环和监控验证。完成后,你应该知道一条预训练任务由哪些文件组成,每个配置文件管什么,以及当训练速度、loss、采样输出或 checkpoint 出问题时应该从哪里开始查。

这一章关注 cookllm-bento 中“如何跑”。如果你想深入理解 Attention、RoPE、RMSNorm、激活函数或优化器原理,可以配合阅读”原理精讲”中的对应章节。

章节内容

预训练数据

理解 Fineweb-Edu-Chinese 数据、采样 shard、默认目录和下载入口

Tokenizer 训练

使用 RustBPE 训练 BPE tokenizer,并导出 tiktoken 编码

模型架构

从 bento_29m.yaml 读懂 BentoLM 的规模、模块和现代 Transformer 技巧

数据流水线