从零手写GPT的实战教程
推荐指数 80.0 NO. 003 · 2026.05.12
Stars92,848
为什么值得看
配套书籍的代码仓库,用Jupyter Notebook手把手实现GPT的预训练和微调全流程。适合想真正理解Transformer内部机制、而非只会调API的工程师。
Implement a ChatGPT-like LLM in PyTorch from scratch, step by step
媒体预览
编辑判断
市面上教LLM原理的资料很多,但大多数停留在数学推导或高层架构图,真正能让你跑通完整训练流程的极少。这个仓库的价值在于把数据加载、注意力实现、分布式训练这些工程细节都暴露出来,而不是封装在黑盒里。
跟Hugging Face的transformers库相比,这里刻意保持代码简洁,方便你动手改结构做实验。如果你已经会用Llama模型但说不清RoPE具体怎么算,或者想自己尝试修改损失函数做领域适配,这是最好的起点。
建议配合书中的章节顺序,先跑通预训练再尝试在自己的语料上微调,比直接读论文效率高得多。
Star History
生态分析
Production
LLM教育基础设施:从零构建Transformer的教学型代码库
独特价值:唯一系统级教学实现,填补理论与实践断层