इस प्रोजेक्ट के बारे में
大规模中文自然语言处理语料库项目(nlp_chinese_corpus)का उद्देश्य चीनी प्राकृतिक भाषा प्रसंस्करण (NLP) के क्षेत्र के विकास में उच्च-गुणवत्ता वाले कोष (corpus) का योगदान देना है। इस परियोजना में कई लाख से लेकर करोड़ों तक के संरचित चीनी डेटासेट शामिल हैं, जिनका उपयोग बड़े मॉडलों के पूर्व-प्रशिक्षण (pre-training), शब्द वेक्टर प्रशिक्षण, पाठ वर्गीकरण, प्रश्न-उत्तर प्रणाली और मशीन अनुवाद जैसे कार्यों में व्यापक रूप से किया जा सकता है।
मुख्य रूप से निम्नलिखित डेटासेट शामिल हैं:
1. विकिपीडिया (wiki2019zh): इसमें 10 लाख अच्छी तरह से संरचित चीनी प्रविष्टियाँ हैं, जिनमें id, url, title और text फ़ील्ड शामिल हैं। यह सामान्य चीनी पूर्व-प्रशिक्षण कोष या ज्ञान-आधारित प्रश्नोत्तर निर्माण के लिए उपयुक्त है।
2. समाचार कोष (news2016zh): इसमें 25 लाख समाचार लेख शामिल हैं, जो 63,000 मीडिया स्रोतों से लिए गए हैं। इनमें शीर्षक, कीवर्ड, विवरण, मुख्य पाठ और प्रकाशन समय शामिल हैं, जो समाचार वर्गीकरण, शीर्षक और कीवर्ड निर्माण के लिए उपयुक्त हैं।
3. विश्वकोश-प्रकार प्रश्नोत्तर (baike2018qa): इसमें 15 लाख पूर्व-फ़िल्टर किए गए उच्च-गुणवत्ता वाले प्रश्न और उत्तर शामिल हैं, जो लगभग 500 विषयों में वर्गीकृत हैं। यह पर्यवेक्षित प्रशिक्षण, वाक्य समानता गणना और प्रश्नोत्तर प्रणाली निर्माण के लिए उपयुक्त है।
4. सामुदायिक प्रश्नोत्तर (webtext2019zh): इसमें 41 लाख उच्च-गुणवत्ता वाले प्रश्न और उत्तर शामिल हैं, जिन्हें लाइक संख्या (कम से कम 3 लाइक) के आधार पर फ़िल्टर किया गया है। यह 28,000 विषयों को कवर करता है और अति-बड़े NLP मॉडल प्रशिक्षण, विषय भविष्यवाणी और cQA प्रणाली के लिए उपयुक्त है।
5. चीनी-अंग्रेज़ी अनुवाद कोष (translation2019zh): इसमें 52 लाख चीनी-अंग्रेज़ी समानांतर वाक्य शामिल हैं, जिनका उपयोग मशीन अनुवाद प्रणाली प्रशिक्षण या अलग से चीनी कोष निकालने के लिए किया जा सकता है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.