इस प्रोजेक्ट के बारे में

HanLP (Han Language Processing) एक उत्पादन-पर्यावरण के लिए बहुभाषी प्राकृतिक भाषा प्रसंस्करण टूलकिट है, जो PyTorch और TensorFlow 2.x दोहरे इंजन पर आधारित है। परियोजना का लक्ष्य अत्याधुनिक NLP तकनीक को लोकप्रिय बनाना है, जिसमें पूर्ण कार्यक्षमता, सटीकता, उच्च प्रदर्शन, नवीनतम कॉर्पस, स्पष्ट वास्तुकला और अनुकूलन क्षमता शामिल हैं। कार्य कवरेज: - शब्द विभाजन (मोटा और बारीक) - POS टैगिंग (CTB, PKU, 863 आदि मानक) - नामित इकाई पहचान (PKU, MSRA, OntoNotes आदि मानक) - आश्रित वाक्यविन्यास विश्लेषण (SD, UD, PMT) - घटक वाक्यविन्यास विश्लेषण (Chinese Tree Bank) - अर्थपूर्ण आश्रित विश्लेषण (CSDP) - अर्थपूर्ण भूमिका लेबलिंग (Chinese Proposition Bank) - अमूर्त अर्थ प्रतिनिधित्व (CAMR) - सहसंदर्भ समाधान - अर्थपूर्ण पाठ समानता - पाठ शैली रूपांतरण - कीवर्ड और वाक्यांश निष्कर्षण - निष्कर्षणात्मक और जनरेटिव स्वचालित सारांश - पाठ व्याकरण सुधार - पाठ वर्गीकरण और भावना विश्लेषण - भाषा पहचान - शब्द वेक्टर और क्लोज़ टेस्ट - सरलीकृत/पारंपरिक चीनी रूपांतरण, पिनयिन, नए शब्द खोज, पाठ क्लस्टरिंग (1.x संस्करण देखें) बहुभाषी समर्थन: बड़े पैमाने पर बहुभाषी कॉर्पस के साथ, HanLP 2.1 सरलीकृत/पारंपरिक चीनी, अंग्रेजी, जापानी, रूसी, फ्रेंच, जर्मन सहित 130 भाषाओं पर 10 संयुक्त कार्यों और कई एकल कार्यों का समर्थन करता है। दो API रूप: 1. हल्का RESTful API: आकार केवल कुछ KB, तेज विकास और मोबाइल ऐप परिदृश्यों के लिए उपयुक्त, GPU वातावरण की आवश्यकता नहीं, त्वरित स्थापना। Python, Golang, Java क्लाइंट प्रदान करता है। 2. विशाल native API: PyTorch, TensorFlow जैसी गहन शिक्षण तकनीकों पर निर्भर, पेशेवर NLP इंजीनियरों, शोधकर्ताओं और स्थानीय बड़े डेटा परिदृश्यों के लिए उपयुक्त। Python 3.6 से 3.10 आवश्यक, Windows समर्थित, Unix-जैसी प्रणाली अनुशंसित, CPU पर चल सकता है, GPU/TPU अनुशंसित। मॉडल प्रकार: - मल्टी-टास्क मॉडल: तेज़, कम मेमोरी, एक कॉल में कई कार्य कर सकता है। - सिंगल-टास्क मॉडल: उच्च सटीकता, अधिक लचीला, पाइपलाइन मोड में असेंबल किया जा सकता है। अनुकूलन क्षमता: कुशल trie ट्री कस्टम शब्दकोश, और तीन नियम (अनिवार्य, विलय, सुधार) का समर्थन करता है; नियमों के प्रभाव को बाद के सांख्यिकीय मॉडल में सहज रूप से लागू किया जा सकता है, जिससे नए डोमेन में तेजी से अनुकूलन होता है। आउटपुट प्रारूप: किसी भी API, विकास भाषा या प्राकृतिक भाषा के लिए, आउटपुट एकसमान रूप से JSON प्रारूप में होता है, जो dict-संगत Document ऑब्जेक्ट है, जिसमें शब्द विभाजन, POS, नामित इकाई, अर्थपूर्ण भूमिका, आश्रित वाक्यविन्यास, अर्थपूर्ण आश्रित, घटक वाक्यविन्यास आदि फ़ील्ड शामिल हैं। Python के RESTful और native API समान-चौड़ाई फ़ॉन्ट-आधारित विज़ुअलाइज़ेशन का भी समर्थन करते हैं, जो कंसोल में भाषाई संरचना दिखा सकते हैं। परियोजना कस्टम डोमेन मॉडल प्रशिक्षण का मार्ग भी प्रदान करती है, और EMNLP पेपर उद्धरण के साथ आती है।