इस प्रोजेक्ट के बारे में
नैनोचैट एक छोटा, हैकेबल प्रयोगात्मक हार्नेस है जो एकल GPU नोड पर बड़े भाषा मॉडलों के प्रशिक्षण के लिए है। यह पूरे LLM पाइपलाइन को कवर करता है: टोकनाइज़ेशन, प्रीट्रेनिंग, फाइनट्यूनिंग (SFT और RL), मूल्यांकन और अनुमान।
प्रोजेक्ट का केंद्रीय दर्शन सरलता है — दसों कॉन्फ़िगरेशन क्लब्स को दिखाने के बजाय, नैनोचैट एकल जटिलता डायल (`--depth`, ट्रांसफॉर्मर परतों की संख्या) का उपयोग करता है जो सभी अन्य हाइपरपैरामीटर्स (मॉडल चौड़ाई, हेड्स, लर्निंग दर, प्रशिक्षण क्षेत्र, वेट डेके) की गणना करता है जो कंप्यूट ऑप्टिमल है। इस पैरामीटर को स्वीप करने से विभिन्न आकारों के मॉडल्स की एक छोटी श्रृंखला प्राप्त होती है।
एक 8×H100 नोड पर GPT-2 वर्ग के मॉडल (लगभग गहराई 24–26) को प्रशिक्षित करने में लगभग 1.5 घंटे लगते हैं और लगभग $48 खरीदारी करते हैं (~$3/GPU/घंटा)। स्पॉट इंस्टेंस पर लागत $15 के पास गिर जाती है। 2019 में मूल GPT-2 प्रशिक्षण की लागत लगभग $43,000 थी।
मुख्य विशेषताएं:
- GPT-4 शैली के चैट रेंडरिंग के साथ BPE टोकनाइज़र
- वैनिला PyTorch में GPT ट्रांसफॉर्मर कार्यान्वयन
- `torchrun` के माध्यम से वितरित प्रशिक्षण जिसमें स्वचालित फॉलबैक एकल-GPU और ग्रेडिएंट एकत्रीकरण है
- `autocast` के बिना ब्याज और फ्लोट16, फ्लोट32 के साथ एक्सप्लिसिट मिक्स्ड प्रिसिशन प्रबंधन
- DCLM CORE स्कोर, बिट्स/बाइट लॉस और कार्य बेंचमार्क (ARC, GSM8K, MMLU, HumanEval) के माध्यम से मूल्यांकन
- चैट मॉडल्स के लिए RL और SFT प्रशिक्षण स्क्रिप्ट
- KV कैश समर्थन वाला अनुमान इंजन
- GPT-2 ग्रेड क्षमता तक वाला दिनचर्या स्पीडरन लीडरबोर्ड
कोडबेस को अनुसंधान इटरेशन के लिए डिज़ाइन किया गया है: एक त्वरित 12-परत प्रयोग (~5 मिनट) डेवलपर्स को पूर्ण प्रशिक्षण से पहले परिवर्तनों का परीक्षण करने की अनुमति देता है। प्रोजेक्ट Andrej Karpathy द्वारा लिखा और संचालित किया जाता है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.