Об этом проекте

Этот репозиторий — официальный сопроводительный код книги «Build a Large Language Model (From Scratch)» Себастьяна Рашки. В нём представлены пошаговые реализации на PyTorch для разработки, предобучения и дообучения GPT-подобной LLM без использования внешних библиотек LLM. Основные главы охватывают обработку текстовых данных и BPE-токенизацию, механизмы внимания, реализацию модели GPT, предобучение на неразмеченных данных, дообучение для классификации текста и инструкционное дообучение. Каждая глава включает Jupyter-ноутбуки, сжатые Python-скрипты и решения упражнений. Приложения охватывают основы PyTorch, параметр-эффективное дообучение LoRA и улучшения цикла обучения. Репозиторий также содержит бонусные материалы, такие как сравнения токенизаторов, KV-кэш, групповое запросное внимание, смесь экспертов и реализации с нуля Llama 3.2, Qwen3, Gemma 3 и других архитектур. Код рассчитан на работу на обычных ноутбуках и может использовать GPU при наличии. Автор также упоминает сопроводительный видеокурс и продолжение книги о построении моделей рассуждения, а также ссылки на форумы обсуждения и сведения о цитировании.