इस प्रोजेक्ट के बारे में

大规模中文自然语言处理语料库项目(nlp_chinese_corpus)का उद्देश्य चीनी प्राकृतिक भाषा प्रसंस्करण (NLP) के क्षेत्र के विकास में उच्च-गुणवत्ता वाले कोष (corpus) का योगदान देना है। इस परियोजना में कई लाख से लेकर करोड़ों तक के संरचित चीनी डेटासेट शामिल हैं, जिनका उपयोग बड़े मॉडलों के पूर्व-प्रशिक्षण (pre-training), शब्द वेक्टर प्रशिक्षण, पाठ वर्गीकरण, प्रश्न-उत्तर प्रणाली और मशीन अनुवाद जैसे कार्यों में व्यापक रूप से किया जा सकता है। मुख्य रूप से निम्नलिखित डेटासेट शामिल हैं: 1. विकिपीडिया (wiki2019zh): इसमें 10 लाख अच्छी तरह से संरचित चीनी प्रविष्टियाँ हैं, जिनमें id, url, title और text फ़ील्ड शामिल हैं। यह सामान्य चीनी पूर्व-प्रशिक्षण कोष या ज्ञान-आधारित प्रश्नोत्तर निर्माण के लिए उपयुक्त है। 2. समाचार कोष (news2016zh): इसमें 25 लाख समाचार लेख शामिल हैं, जो 63,000 मीडिया स्रोतों से लिए गए हैं। इनमें शीर्षक, कीवर्ड, विवरण, मुख्य पाठ और प्रकाशन समय शामिल हैं, जो समाचार वर्गीकरण, शीर्षक और कीवर्ड निर्माण के लिए उपयुक्त हैं। 3. विश्वकोश-प्रकार प्रश्नोत्तर (baike2018qa): इसमें 15 लाख पूर्व-फ़िल्टर किए गए उच्च-गुणवत्ता वाले प्रश्न और उत्तर शामिल हैं, जो लगभग 500 विषयों में वर्गीकृत हैं। यह पर्यवेक्षित प्रशिक्षण, वाक्य समानता गणना और प्रश्नोत्तर प्रणाली निर्माण के लिए उपयुक्त है। 4. सामुदायिक प्रश्नोत्तर (webtext2019zh): इसमें 41 लाख उच्च-गुणवत्ता वाले प्रश्न और उत्तर शामिल हैं, जिन्हें लाइक संख्या (कम से कम 3 लाइक) के आधार पर फ़िल्टर किया गया है। यह 28,000 विषयों को कवर करता है और अति-बड़े NLP मॉडल प्रशिक्षण, विषय भविष्यवाणी और cQA प्रणाली के लिए उपयुक्त है। 5. चीनी-अंग्रेज़ी अनुवाद कोष (translation2019zh): इसमें 52 लाख चीनी-अंग्रेज़ी समानांतर वाक्य शामिल हैं, जिनका उपयोग मशीन अनुवाद प्रणाली प्रशिक्षण या अलग से चीनी कोष निकालने के लिए किया जा सकता है।