इस प्रोजेक्ट के बारे में

《हाथों-हाथ बड़े मॉडल सीखें (Dive into LLMs)》 शंघाई जिओतोंग विश्वविद्यालय के पाठ्यक्रमों "प्राकृतिक भाषा प्रसंस्करण की अत्याधुनिक तकनीकें" (NIS8021) और "आर्टिफिशियल इंटेलिजेंस सुरक्षा प्रौद्योगिकियां" (NIS3353) के व्याख्यान नोट्स से विस्तारित एक श्रृंखला है, जिसे प्रोफेसर झांग झुओशेंग की टीम द्वारा विकसित किया गया है, जो सार्वजनिक कल्याण और पूरी तरह से मुफ्त है। इस परियोजना का उद्देश्य सरल अभ्यासों के माध्यम से शिक्षार्थियों को बड़े मॉडलों में त्वरित प्रवेश देना है, जिससे पाठ्यक्रम डिजाइन या शैक्षणिक अनुसंधान को बेहतर ढंग से आगे बढ़ाया जा सके। ट्यूटोरियल में कुल 11 अध्याय हैं, प्रत्येक अध्याय में व्याख्यान स्लाइड (पीडीएफ), ट्यूटोरियल नोट्स (README), और चलाने योग्य जुपिटर नोटबुक स्क्रिप्ट शामिल हैं: 1. माइक्रो-ट्यूनिंग और तैनाती: पूर्व-प्रशिक्षित मॉडलों के माइक्रो-ट्यूनिंग और तैनाती के लिए मार्गदर्शिका, जिसमें मॉडल चयन, विशिष्ट कार्यों के लिए माइक्रो-ट्यूनिंग, और डेमो तैनाती शामिल है। 2. प्रॉम्प्ट लर्निंग और चेन-ऑफ-थॉट: बड़े मॉडल एपीआई कॉल और तर्क के लिए मार्गदर्शिका, प्रॉम्प्ट इंजीनियरिंग और चेन-ऑफ-थॉट तकनीकों की खोज। 3. ज्ञान संपादन: भाषा मॉडलों के लिए संपादन विधियां और उपकरण, जो विशिष्ट ज्ञान के संपादन और सत्यापन को सक्षम करते हैं। 4. गणितीय तर्क: आसवन के माध्यम से मिनी R1 मॉडल का उपयोग करके बड़े मॉडलों को गणितीय तर्क क्षमताएं सिखाना। 5. मॉडल वॉटरमार्किंग: भाषा मॉडल द्वारा उत्पन्न सामग्री में मानव-अदृश्य वॉटरमार्क एम्बेड करने की तकनीकें। 6. जेलब्रेक हमले: समझें कि जेलब्रेक हमले बड़े मॉडलों की सुरक्षा रेखाओं को कैसे तोड़ते हैं, हमले के दृष्टिकोण से सुरक्षा को समझना। 7. बड़े मॉडल स्टेग्नोग्राफी: बड़े मॉडलों को सहज उत्तर देते हुए छिपी हुई जानकारी ले जाने देना जिसे केवल विशिष्ट प्राप्तकर्ता ही पहचान सकें। 8. मल्टीमॉडल मॉडल: अन्वेषण करें कि मल्टीमॉडल बड़े भाषा मॉडल अधिक शक्तिशाली मल्टीमॉडल समझ और पीढ़ी क्षमताओं को कैसे प्राप्त करते हैं। 9. GUI एजेंट: AI एजेंटों को उपयोगकर्ताओं के लिए भोजन ऑर्डर करने, संदेशों का उत्तर देने, खरीदारी तुलना आदि जैसे GUI संचालन कार्यों को पूरा करने देना। 10. एजेंट सुरक्षा: खुले एजेंट परिदृश्यों में बड़े मॉडलों के जोखिम खतरों और सुरक्षा जागरूकता पर चर्चा। 11. RLHF सुरक्षा संरेखण: PPO-आधारित RLHF प्रयोगों के लिए मार्गदर्शिका, जिसमें मानव प्रतिक्रिया से सुदृढीकरण सीखने के सुरक्षा संरेखण अभ्यास शामिल हैं। इसके अतिरिक्त, परियोजना ने हुआवेई एसेंड समुदाय के साथ मिलकर एक स्वदेशी "बड़े मॉडल विकास पूर्ण प्रक्रिया" सार्वजनिक कल्याण ट्यूटोरियल लॉन्च किया है, जो एसेंड बुनियादी सॉफ्टवेयर और हार्डवेयर पर आधारित है, जिसमें पीपीटी, प्रयोग मैनुअल, और वीडियो जैसे ट्यूटोरियल प्रारूप शामिल हैं, जो प्राथमिक, मध्यवर्ती, और उन्नत श्रृंखलाओं में विभाजित हैं, जो विभिन्न बड़े मॉडल अभ्यास आवश्यकताओं को पूरा करते हैं, जो क्रमिक रूप से त्वरित शुरुआत, एसेंड-समर्थित मॉडलों का अनुप्रयोग, और नए मॉडल स्थानांतरण और अनुकूलन के लिए पूर्ण-प्रक्रिया विकास मार्गदर्शिका प्रदान करते हैं। यह परियोजना शंघाई जिओतोंग विश्वविद्यालय, सिंगापुर राष्ट्रीय विश्वविद्यालय, और हुआवेई एसेंड समुदाय की कई टीमों द्वारा संयुक्त रूप से योगदान की गई है, और चर्चा और सुधार के लिए Issue और PR का स्वागत करती है।