このプロジェクトについて
PlanckGPTは、一般消費者向けハードウェアでGPTスタイルの言語モデルをゼロから学習する方法を示す教育用プロジェクトです。モデルは約5億4000万パラメータで、Fineweb-eduデータセットの約20億トークンで事前学習され、Smol-smoltalkデータを使用した任意のチャット微調整段階を備えています。
このプロジェクトは、品質と学習時間の比率を最大化することを目指しており、学習時間のソフト制限は50時間です。著者のノートPC(Intel Core i7 14700HX、24GB RAM、RTX 5070 Mobile 8GB)では、事前学習に約28時間20分、チャット微調整に約4時間10分かかります。
アーキテクチャは、14層のTransformerデコーダ、7つのクエリヘッド、896次元の埋め込み、回転位置埋め込み、交互の値埋め込み、2乗ReLU活性化、RMSNormを使用します。トークナイザーはGPT-2エンコーディング(語彙サイズ50,257)のTiktokenです。学習には、Transformer重み用のNorMuonオプティマイザ、埋め込み用の8ビットAdam、BF16混合精度、勾配チェックポイント、torch.compileを採用しています。
このプロジェクトには、事前学習、評価、チャット微調整、推論のスクリプトが用意されています。事前学習済みモデルの性能はGPT-2-mediumに近く、Fineweb-eduで平均検証損失約2.97です。チャット微調整済みモデルはSmol-smoltalkで平均検証損失約1.13を達成しています。推論ではtop-kおよびtop-pサンプリングとKVキャッシュを使用して生成を高速化しています。
このプロジェクトはmodded-nanogptとnanochatに触発され、Apache 2.0ライセンスの下で提供されています。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.