このプロジェクトについて
このリポジトリは、Sebastian Raschka著『Build a Large Language Model (From Scratch)』の公式コンパニオンコードです。外部のLLMライブラリに依存せず、GPT系LLMの開発、事前学習、微調整を段階的にPyTorchで実装しています。主な章では、テキストデータ処理とBPEトークン化、アテンション機構、GPTモデルの実装、ラベルなしデータでの事前学習、テキスト分類のための微調整、指示微調整を扱います。各章にはJupyterノートブック、要約されたPythonスクリプト、演習の解答が含まれます。付録ではPyTorchの基礎、LoRAによるパラメータ効率の良い微調整、トレーニングループの拡張を扱います。リポジトリには、トークナイザ比較、KVキャッシュ、grouped-query attention、mixture-of-experts、Llama 3.2、Qwen3、Gemma 3などのアーキテクチャのスクラッチ実装といったボーナス資料も含まれます。コードは一般的なラップトップで動作するように設計されており、GPUが利用可能な場合は使用できます。著者は、コンパニオンビデオコースと推論モデル構築に関する続編書籍についても言及し、ディスカッションフォーラムへのリンクと引用情報も提供しています。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.