프로젝트 소개
이 저장소는 Sebastian Raschka의 저서 *Build a Large Language Model (From Scratch)*의 공식 동반 코드입니다. 외부 LLM 라이브러리에 의존하지 않고 GPT 유사 LLM을 개발, 사전 학습, 미세 조정하기 위한 단계별 PyTorch 구현을 제공합니다. 주요 장에서는 텍스트 데이터 처리와 BPE 토큰화, 어텐션 메커니즘, GPT 모델 구현, 레이블 없는 데이터에 대한 사전 학습, 텍스트 분류를 위한 미세 조정, 명령 미세 조정을 다룹니다. 각 장에는 Jupyter 노트북, 요약된 Python 스크립트, 연습문제 해답이 포함되어 있습니다. 부록에서는 PyTorch 기초, LoRA 파라미터 효율적 미세 조정, 학습 루프 개선을 다룹니다. 저장소에는 토크나이저 비교, KV 캐시, 그룹 쿼리 어텐션, 전문가 혼합, 그리고 Llama 3.2, Qwen3, Gemma 3 및 기타 아키텍처의 처음부터 구현한 보너스 자료도 포함되어 있습니다. 코드는 일반 노트북에서 실행되도록 설계되었으며 GPU가 있으면 사용할 수 있습니다. 저자는 또한 동반 영상 강좌와 추론 모델 구축에 관한 후속 저서, 토론 포럼 링크 및 인용 세부 정보를 언급합니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.