夜雨聆风学习资料网

ARTICLE · 1062173

单卡就能跑通:真源码级大模型全栈工程教程

单卡就能跑通:真源码级大模型全栈工程教程

单卡就能跑通:真源码级大模型全栈工程教程

这个在 GitHub 上斩获了 9.9K 颗星的开源仓库,本质上就是一个隐藏在单个代码库里的完整 LLM(大语言模型)工程教程。
它从最原始的文本数据开始,完全用纯 PyTorch 语法从头构建 Transformer 架构,随后一路贯穿预训练(Pretraining)、有监督微调(SFT)、奖励模型(Reward Modeling),以及 DPO、PPO 和最新的 GRPO 强化学习算法。全程没有使用任何 transformers、trl 或 peft 等第三方库来隐藏底层的训练循环。
其最小的模型仅有 13M(1300万)参数,因此你完全可以在单张 GPU 上运行全流程,并真真切切地观察到模型在每一个阶段所发生的变化。
p.s:
GRPO(群组相对策略优化):这是 DeepSeek-R1 爆火后带出名的高效强化学习算法,不需要单独训练一个庞大的奖励模型,直接在群组内部进行相对对比,极大地节省了显存。
No hiding the training loops:市面上的教程大多喜欢直接调 Hugging Face 的 API,这导致新手根本不懂底层数学原理。而该项目把所有底层的 Training Loops(训练循环)原汁原味地写了出来,是真正不玩虚的“硬核源码级”教学。

泰国,1小时前,

相关学习资料