عن المشروع
PlanckGPT هو مشروع تعليمي يوضح كيفية تدريب نموذج لغة من نوع GPT من الصفر على أجهزة المستوى الاستهلاكي. يحتوي النموذج على حوالي 540 مليون معامل ويتم تدريبه مسبقًا على حوالي 2 مليار رمز من مجموعة بيانات Fineweb-edu، مع مرحلة اختيارية لضبط دقيق للمحادثة باستخدام بيانات Smol-smoltalk.
يهدف المشروع إلى تحقيق أفضل نسبة جودة إلى وقت تدريب، مع حد أقصى تقريبي يبلغ 50 ساعة من وقت التدريب. على كمبيوتر المؤلف المحمول (Intel Core i7 14700HX، ذاكرة 24GB، بطاقة RTX 5070 Mobile بسعة 8GB)، يستغرق التدريب المسبق حوالي 28 ساعة و20 دقيقة، بينما يستغرق الضبط الدقيق للمحادثة حوالي 4 ساعات و10 دقائق.
تستخدم البنية محولًا لفك التشفير من 14 طبقة مع 7 رؤوس استعلام، وتمثيلات أبعادها 896، وتمثيلات موضعية دوارة، وتمثيلات قيم متناوبة، وتفعيل ReLU مربع، وRMSNorm. المُرمِّز هو Tiktoken مع ترميز GPT-2 (حجم مفردات 50,257). يستخدم التدريب مُحسِّن NorMuon لأوزان المحول، وAdam بدقة 8 بت للتمثيلات، ودقة مختلطة BF16، وفحص تدرجات، وtorch.compile.
يوفر المشروع نصوصًا برمجية للتدريب المسبق والتقييم والضبط الدقيق للمحادثة والاستدلال. الأداء بعد التدريب المسبق قريب من GPT-2-medium بمتوسط خسارة تحقق حوالي 2.97 على Fineweb-edu. يصل الأداء بعد الضبط الدقيق للمحادثة إلى متوسط خسارة تحقق حوالي 1.13 على Smol-smoltalk. يستخدم الاستدلال أخذ العينات بأعلى k وأعلى p مع ذاكرة تخزين KV لتوليد أسرع.
المشروع مستوحى من modded-nanogpt وnanochat، ومرخص بموجب Apache 2.0.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.