منصوبے کے بارے میں

PlanckGPT ایک تعلیمی پروجیکٹ ہے جو یہ ظاہر کرتا ہے کہ GPT طرز کے لینگویج ماڈل کو صارفین کے درجے کے ہارڈویئر پر شروع سے کیسے تربیت دی جا سکتی ہے۔ ماڈل میں تقریباً 540 ملین پیرامیٹرز ہیں اور اسے Fineweb-edu ڈیٹاسیٹ سے تقریباً 2 بلین ٹوکنز پر پری ٹرین کیا گیا ہے، جس میں Smol-smoltalk ڈیٹا کا استعمال کرتے ہوئے اختیاری چیٹ فائن ٹیوننگ مرحلہ شامل ہے۔ پروجیکٹ کا ہدف بہترین کوالٹی سے تربیتی وقت کا تناسب حاصل کرنا ہے، جس میں تربیت کے وقت کی نرم حد 50 گھنٹے ہے۔ مصنف کے لیپ ٹاپ (Intel Core i7 14700HX، 24GB RAM، RTX 5070 Mobile 8GB) پر، پری ٹریننگ میں تقریباً 28 گھنٹے اور 20 منٹ لگتے ہیں، جبکہ چیٹ فائن ٹیوننگ میں تقریباً 4 گھنٹے اور 10 منٹ لگتے ہیں۔ آرکیٹیکچر میں 14 پرتوں والا ٹرانسفارمر ڈیکوڈر استعمال کیا گیا ہے جس میں 7 کوئری ہیڈز، 896-ڈائمینشنل ایمبیڈنگز، روٹری پوزیشنل ایمبیڈنگز، متبادل ویلیو ایمبیڈنگز، اسکوائرڈ ReLU ایکٹیویشن، اور RMSNorm شامل ہیں۔ ٹوکنائزر Tiktoken ہے جس میں GPT-2 انکوڈنگ (50,257 ووکیبولری سائز) ہے۔ تربیت میں ٹرانسفارمر وزن کے لیے NorMuon آپٹیمائزر، ایمبیڈنگز کے لیے 8-bit Adam، BF16 مکسڈ پریسجن، گریڈینٹ چیک پوائنٹنگ، اور torch.compile استعمال کیا جاتا ہے۔ پروجیکٹ پری ٹریننگ، تشخیص، چیٹ فائن ٹیوننگ، اور انفرنس کے لیے اسکرپٹ فراہم کرتا ہے۔ پری ٹرینڈ کارکردگی GPT-2-medium کے قریب ہے جس میں Fineweb-edu پر تقریباً 2.97 اوسط توثیقی نقصان ہے۔ چیٹ فائن ٹیونڈ کارکردگی Smol-smoltalk پر تقریباً 1.13 اوسط توثیقی نقصان تک پہنچتی ہے۔ انفرنس میں تیز تر جنریشن کے لیے KV کیش کے ساتھ top-k اور top-p سیمپلنگ استعمال ہوتی ہے۔ یہ پروجیکٹ modded-nanogpt اور nanochat سے متاثر ہے، اور Apache 2.0 لائسنس کے تحت لائسنس یافتہ ہے۔