这个项目能做什么

本仓库是 Sebastian Raschka 所著《Build a Large Language Model (From Scratch)》一书的官方配套代码。它提供了循序渐进的 PyTorch 实现,用于开发、预训练和微调类 GPT 的大语言模型,且不依赖外部 LLM 库。主要章节涵盖文本数据处理与 BPE 分词、注意力机制、实现 GPT 模型、在无标注数据上进行预训练、面向文本分类的微调,以及指令微调。每章都包含 Jupyter notebook、精简后的 Python 脚本和练习解答。附录涵盖 PyTorch 基础、LoRA 参数高效微调以及训练循环增强。该仓库还包含额外材料,例如分词器对比、KV cache、grouped-query attention、mixture-of-experts,以及 Llama 3.2、Qwen3、Gemma 3 和其他架构的从零实现。代码设计为可在普通笔记本电脑上运行,并可在有 GPU 时使用 GPU。作者还提到配套视频课程和一本关于构建推理模型的续作,以及讨论论坛链接和引用信息。