इस प्रोजेक्ट के बारे में

Cantonese-LLM-Lab एक ओपन-सोर्स परियोजना है जो कैंटोनीज़ बड़े भाषा मॉडल फाइन-ट्यूनिंग, मूल्यांकन और घरेलू Ascend हार्डवेयर अनुकूलन पर केंद्रित है, जो मुख्य रूप से उन शोधकर्ताओं और इंजीनियरों के लिए है जो कैंटोनीज़ प्रश्न-उत्तर मॉडल को पुन: प्रस्तुत या सुधारना चाहते हैं। यह परियोजना LLM समीक्षा पर निर्भर नहीं करती, बल्कि एक पुन: प्रयोज्य वस्तुनिष्ठ मूल्यांकन ढांचा प्रदान करती है: HKMMLU आधिकारिक मानक पूर्ण मूल्यांकन, आधिकारिक कैंटोनीज़-मंदारिन पारस्परिक अनुवाद कार्य, लिखित कैंटोनीज़ शुद्धता, पतन पहचान और perplexity, तथा सभी प्रश्नों पर जोड़ीवार McNemar सटीक परीक्षण। परियोजना में छह मुख्य भाग शामिल हैं: पहला उपरोक्त मूल्यांकन ढांचा; दूसरा प्रॉम्प्ट एब्लेशन विधि, जो 2×2 (भाषा × प्रारूप स्कैफोल्ड) का उपयोग करके जाँचती है कि रैंकिंग प्रॉम्प्ट चयन से प्रभावित होती है या नहीं; तीसरा रिलीज़ गेट, जो non-inferiority परीक्षण और δ संवेदनशीलता जाँच अपनाता है; चौथा LoRA निदान उपकरण, जो मॉड्यूल-दर-मॉड्यूल ‖ΔW‖/‖W‖ की गणना करता है; पाँचवाँ बहु-स्रोत कैंटोनीज़ SFT डेटा पुनर्निर्माण स्क्रिप्ट, जिसमें सरलीकृत-पारंपरिक सामान्यीकरण, दो-स्तरीय डीडुप्लिकेशन और पहले विभाजन फिर प्रशिक्षण शामिल है; छठा Ascend 910C अनुकूलन रिकॉर्ड, जिसमें CUDA से माइग्रेशन में केवल 4 पंक्तियाँ बदलने की आवश्यकता, नेटिव W8A8 क्वांटाइज़ेशन, ग्राफ मोड अनुकूलन के नकारात्मक परिणाम, तथा त्रुटि संदेश और वास्तविक मूल कारण के बीच बेमेल की समस्याएँ शामिल हैं। रिपॉजिटरी पूर्ण मूल्यांकन, प्रशिक्षण और तैनाती स्क्रिप्ट प्रदान करती है, जिसमें eval/ के अंतर्गत कई मूल्यांकन और सांख्यिकी उपकरण, data/build_yue_sft.py डेटा निर्माण स्क्रिप्ट, train/ के अंतर्गत LoRA प्रशिक्षण और विलय स्क्रिप्ट, तथा deploy/ के अंतर्गत CUDA और Ascend तैनाती मार्गदर्शिकाएँ शामिल हैं। परिणाम दस्तावेज़ 8B और 30B-A3B दो मॉडल लाइनों का विस्तृत तुलनात्मक विवरण, प्रॉम्प्ट एब्लेशन, डेटा एब्लेशन और क्वांटाइज़ेशन प्रयोग दर्ज करते हैं। मॉडल वेट Hugging Face पर गेटेड रिपॉजिटरी में प्रकाशित किए गए हैं, जिनमें bf16 विलय संस्करण, Ascend नेटिव W8A8 डायनामिक क्वांटाइज़्ड संस्करण, int4 संस्करण, केवल सार्वजनिक डेटा से प्रशिक्षित एब्लेशन संस्करण और LoRA adapter शामिल हैं। कोड MIT लाइसेंस के अंतर्गत है, मूल्यांकन में प्रयुक्त डेटासेट अपने-अपने लाइसेंस का पालन करते हैं।