منصوبے کے بارے میں
nanochat ایک تجرباتی، کمپیوٹیشنally موثر اور ہیک ایبل ہارنیس ہے جو سنگل GPU نوڈ پر بڑے زبان کے ماڈلز (LLMs) کی تربیت کے لیے استعمال ہوتا ہے۔ یہ ٹوکنائزیشن، pretraining، SFT اور RL کے ذریعے finetuning، evaluation، اور inference کے سارے مراحل کو منطبق کرتا ہے۔
پروجیکٹ کا مرکزی اصول سادگی ہے — یہ مختلف configuration knobs کے بجائے صرف ایک 'depth' ڈائل استعمال کرتا ہے (جو transformer layers کی تعداد ہے)، جس کے ذریعے دیگر سارے hyperparameters جیسے model width، heads، learning rate، training horizon، weight decay وغیرہ خودکار طور پر compute-optimal طریقے سے اخذ کیے جاتے ہیں۔ اس ایک پیرامیٹر کو sweep کر کے مختلف سائز کے ماڈلز کا سلسلہ حاصل کیا جا سکتا ہے。
GPT-2 جماعت کا ماڈل (تقریباً depth 24–26) 8×H100 نوڈ پر تقریباً 1.5 گھنٹے میں تربیت دیا جا سکتا ہے، جس کی لاگت تقریباً $48 ($3/GPU/hr) ہے۔ spot instances پر لاگت تقریباً $15 رہ جاتی ہے۔ جبکہ اصل GPT-2 کی تربیت 2019 میں تقریباً $43,000 میں ہوئی تھی。
اہم خصوصیات:
- BPE tokenizer اور GPT-4 کے انداز میں chat rendering
- معیاری PyTorch میں GPT transformer implementation
- torchrun کے ذریعے distributed training، جو خودکار طور پر single-GPU اور gradient accumulation پر fallback کرتا ہے
- bfloat16، float16، اور float32 کی صریح mixed-precision management بغیر autocast کے
- DCLM CORE score، bits-per-byte loss، اور task benchmarks (ARC، GSM8K، MMLU، HumanEval) کے ذریعے evaluation
- chat models کے لیے RL اور SFT training scripts
- KV cache support والی inference engine
- ایک speedrun leaderboard جو wall-clock time کے ذریعے GPT-2 سطح کی صلاحیت تک پہنچنے کا وقت ریکارڈ کرتا ہے
یہ codebase research iteration کے لیے بنایا گیا ہے: ایک فوری 12-layer experiment (~5 منٹ) ڈویلپر کو مکمل تربیت سے پہلے تبدیلیوں کا امتحان کرنے کی اجازت دیتا ہے۔ پروجیکٹ Andrej Karpathy نے لکھا اور برقرار رکھا ہے۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.