इस प्रोजेक्ट के बारे में
प्लैंकजीपीटी एक शैक्षिक परियोजना है जो दर्शाती है कि उपभोक्ता-स्तरीय हार्डवेयर पर GPT-शैली के भाषा मॉडल को शुरू से कैसे प्रशिक्षित किया जा सकता है। इस मॉडल में लगभग 540 मिलियन पैरामीटर हैं और इसे Fineweb-edu डेटासेट से लगभग 2 बिलियन टोकन पर प्रीट्रेन किया गया है, साथ ही Smol-smoltalk डेटा का उपयोग करके एक वैकल्पिक चैट फाइन-ट्यूनिंग चरण भी है।
यह परियोजना गुणवत्ता-से-प्रशिक्षण-समय अनुपात को अधिकतम करने का लक्ष्य रखती है, जिसमें प्रशिक्षण समय की नरम सीमा 50 घंटे है। लेखक के लैपटॉप (Intel Core i7 14700HX, 24GB RAM, RTX 5070 Mobile 8GB) पर प्रीट्रेनिंग में लगभग 28 घंटे और 20 मिनट लगते हैं, जबकि चैट फाइन-ट्यूनिंग में लगभग 4 घंटे और 10 मिनट लगते हैं।
आर्किटेक्चर में 14-परत वाला ट्रांसफॉर्मर डिकोडर है जिसमें 7 क्वेरी हेड, 896-आयामी एम्बेडिंग, रोटरी पोजीशनल एम्बेडिंग, वैकल्पिक वैल्यू एम्बेडिंग, स्क्वेर्ड ReLU सक्रियण और RMSNorm शामिल हैं। टोकनाइज़र Tiktoken है जिसमें GPT-2 एन्कोडिंग (50,257 वोकैबुलरी आकार) है। प्रशिक्षण में ट्रांसफॉर्मर वेट के लिए NorMuon ऑप्टिमाइज़र, एम्बेडिंग के लिए 8-बिट Adam, BF16 मिश्रित परिशुद्धता, ग्रेडिएंट चेकपॉइंटिंग और torch.compile का उपयोग किया जाता है।
यह परियोजना प्रीट्रेनिंग, मूल्यांकन, चैट फाइन-ट्यूनिंग और अनुमान के लिए स्क्रिप्ट प्रदान करती है। प्रीट्रेनड प्रदर्शन GPT-2-medium के करीब है, जिसमें Fineweb-edu पर लगभग 2.97 औसत वैलिडेशन लॉस है। चैट फाइन-ट्यून किया गया प्रदर्शन Smol-smoltalk पर लगभग 1.13 औसत वैलिडेशन लॉस तक पहुँचता है। अनुमान में तेज़ जनरेशन के लिए KV कैश के साथ top-k और top-p सैंपलिंग का उपयोग किया जाता है।
यह परियोजना modded-nanogpt और nanochat से प्रेरित है, और Apache 2.0 के तहत लाइसेंस प्राप्त है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.