इस प्रोजेक्ट के बारे में

## परियोजना अवलोकन Chinese-LLaMA-Alpaca चीनी प्राकृतिक भाषा प्रसंस्करण पर केंद्रित एक खुला स्रोत बड़ा भाषा मॉडल परियोजना है, जिसका उद्देश्य चीनी समुदाय में बड़े मॉडलों के खुले अनुसंधान को बढ़ावा देना है। यह परियोजना मूल LLaMA के आधार पर चीनी शब्दावली का विस्तार करती है तथा चीनी भाषा के आधारभूत शब्दार्थ समझ को बेहतर बनाने के लिए चीनी पाठ्य सामग्री से द्वितीयक पूर्व-प्रशिक्षण करती है; इसके अलावा, चीनी Alpaca मॉडल को निर्देशों को समझने और निष्पादित करने की क्षमता बढ़ाने हेतु चीनी निर्देश डेटा से सूक्ष्म-समायोजित किया जाता है। इस परियोजना के साथ तकनीकी रिपोर्ट "Efficient and Effective Text Encoding for Chinese LLaMA and Alpaca" (arXiv:2304.08177) जुड़ी है। ## मुख्य क्षमताएँ - मूल LLaMA के लिए चीनी शब्दावली का विस्तार, जिससे चीनी एन्कोडिंग/डिकोडिंग दक्षता बढ़ती है। - चीनी पाठ से पूर्व-प्रशिक्षित चीनी LLaMA तथा निर्देश-सूक्ष्म-समायोजित चीनी Alpaca का खुला स्रोत रूप में उपलब्ध होना। - उपयोगकर्ताओं को आवश्यकतानुसार प्रशिक्षण जारी रखने हेतु पूर्व-प्रशिक्षण और निर्देश-ट्यूनिंग स्क्रिप्ट प्रदान करना। - व्यक्तिगत कंप्यूटर (लैपटॉप) पर CPU/GPU स्थानीय क्वांटाइज़ेशन और परिनियोजन का समर्थन। - transformers, llama.cpp, text-generation-webui, LlamaChat, LangChain, privateGPT आदि पारिस्थितिकी उपकरणों के साथ संगतता। ## मॉडल संस्करण खुले स्रोत मॉडल आकार 7B, 13B और 33B हैं, प्रत्येक आकार में बेस, Plus और Pro संस्करण उपलब्ध हैं। Plus श्रृंखला अधिक प्रशिक्षण डेटा का उपयोग करती है, जबकि Pro श्रृंखला अत्यधिक छोटे उत्तरों की समस्या को सुधारती है। मॉडल दो प्रकार के हैं: - चीनी LLaMA: बेस मॉडल, पारंपरिक CLM प्रशिक्षण पर आधारित, पाठ निरंतरता के लिए उपयुक्त, निर्देश समझ और बहु-मोड़ चैट के लिए उपयुक्त नहीं। - चीनी Alpaca: निर्देश समझने वाला मॉडल, निर्देश-ट्यूनिंग पर आधारित, प्रश्नोत्तर, लेखन, सुझाव और बहु-मोड़ संदर्भ समझ के लिए उपयुक्त। मूल LLaMA की लाइसेंस सीमाओं के कारण, परियोजना केवल LoRA वज़न जारी करती है, जिन्हें मूल LLaMA के साथ विलय करने के बाद ही पूर्ण मॉडल प्राप्त होता है; ये अकेले उपयोग नहीं किए जा सकते। ## उपयोग प्रक्रिया 1. Hugging Face, ModelScope या Baidu Netdisk से संबंधित LoRA वज़न डाउनलोड करें। 2. LoRA वज़न को मूल LLaMA के साथ विलय करें; ऑनलाइन रूपांतरण (Colab notebook) या मैनुअल रूपांतरण ट्यूटोरियल का संदर्भ लें। 3. अनुमान और परिनियोजन विधि चुनें, जिसमें llama.cpp, Transformers, text-generation-webui, LlamaChat, LangChain, privateGPT, Colab Gradio Demo तथा OpenAI-जैसा API Demo शामिल है। 4. कार्य के प्रकार के अनुसार उपयुक्त मॉडल और प्रारंभ पैरामीटर चुनें, उदाहरण के लिए Alpaca के लिए टेम्पलेट-आधारित इनपुट प्रारूप का उपयोग करें। विलय के बाद मॉडल आकार बदलता है; उदाहरण के लिए 7B FP16 में लगभग 13GB और 4-bit क्वांटाइज़ेशन में लगभग 3.9GB होता है; 33B FP16 में लगभग 60GB और 4-bit क्वांटाइज़ेशन में लगभग 17.2GB होता है। ## प्रशिक्षण विवरण प्रशिक्षण प्रक्रिया में तीन भाग शामिल हैं: शब्दावली विस्तार, पूर्व-प्रशिक्षण और निर्देश-ट्यूनिंग। शब्दावली विस्तार कोड merge_tokenizers.py में देखें; पूर्व-प्रशिक्षण और निर्देश-ट्यूनिंग कोड transformers के run_clm.py और Stanford Alpaca के डेटासेट प्रोसेसिंग भाग पर आधारित है। संबंधित प्रशिक्षण स्क्रिप्ट Wiki में खुले तौर पर उपलब्ध हैं। ## मूल्यांकन परियोजना ने C-Eval डेटासेट पर कई मॉडलों का वस्तुनिष्ठ मूल्यांकन किया है; परीक्षण सेट में लगभग 12.3K बहुविकल्पीय प्रश्न हैं, जो 52 विषयों को कवर करते हैं। README में प्रत्येक मॉडल का valid/test सेट पर zero-shot और 5-shot औसत स्कोर सूचीबद्ध है, जैसे Chinese-Alpaca-Plus-33B का test 5-shot स्कोर 43.5 है। परियोजना में पीढ़ी परिणाम मूल्यांकन उदाहरण और ऑनलाइन प्रतियोगिता मंच भी उपलब्ध है। ## सीमाएँ और अस्वीकरण परियोजना स्पष्ट रूप से कहती है कि मॉडल अप्रत्याशित हानिकारक सामग्री या मानवीय प्राथमिकताओं के अनुरूप नहीं होने वाली सामग्री उत्पन्न कर सकते हैं; संसाधन और डेटा की सीमाओं के कारण प्रशिक्षण पर्याप्त नहीं है और चीनी समझ क्षमता में अभी सुधार की गुंजाइश है; परियोजना स्वयं कोई ऑनलाइन इंटरैक्टिव डेमो प्रदान नहीं करती है, उपयोगकर्ताओं को स्थानीय रूप से परिनियोजन करना होगा। संबंधित संसाधन केवल शैक्षणिक अनुसंधान के लिए हैं, व्यावसायिक उपयोग निषिद्ध है, और मॉडल आउटपुट की शुद्धता की गारंटी नहीं दी जाती है। ## संबंधित परियोजनाएँ आधिकारिक अनुवर्ती परियोजनाओं में Chinese-LLaMA-Alpaca-2 (चीनी LLaMA-2, Alpaca-2 बड़ा मॉडल) और Visual-Chinese-LLaMA-Alpaca (मल्टीमॉडल चीनी LLaMA और Alpaca बड़ा मॉडल) शामिल हैं।