इस प्रोजेक्ट के बारे में

ओपन चाइनीज़ कन्वर्ट (OpenCC) विभिन्न चीनी अक्षर सेटों और क्षेत्रीय लेखन रीति-रिवाजों के बीच उच्च गुणवत्ता वाले टेक्स्ट रूपांतरण के लिए डिज़ाइन किया गया एक व्यापक ओपन-सोर्स प्रोजेक्ट है। यह पारंपरिक चीनी, सरलीकृत चीनी, जापानी शिंजिताई (नए अक्षर रूप), और चीन के मुख्य भूमि, ताइवान और होंग कॉंग में पाए जाने वाले विशिष्ट क्षेत्रीय शब्दार्थ प्राथमिकताओं के बीच रूपांतरण का समर्थन करता है। मुख्य विशेषताएं: - निर्धारक, शब्दकोश-आधारित रूपांतरण जो बड़े भाषा मॉडलों (LLMs) पर निर्भर नहीं करता है, जिससे स्थिर, पूर्वानुमेय और तेज़ ऑफ़लाइन परिणाम मिलते हैं। - अलग किए गए शब्दकोश और लाइब्रेरी, जो अनुकूलन और विस्तार की अनुमति देते हैं। - सरलीकृत-पारंपरिक मैपिंग और अक्षर परिवर्तन मैपिंग के बीच सख्त भेद, "जहाँ भी अलग किया जा सके, वहां अलग करें" के सिद्धांत का पालन करते हुए। - क्षेत्रीय मुहावरों और अक्षर परिवर्तनों का समर्थन (उदाहरण के लिए, "माउस" को "स्लाइड माउस" में बदलना)। - जापानी शिंजिताई और क्यूजिताई (पुराने अक्षर रूप) के बीच रूपांतरण के लिए सीमित समर्थन। प्रोजेक्ट कई इंटरफेस और टूल्स प्रदान करता है: - **लाइब्रेरी**: C++, C, Python और Node.js के लिए उपलब्ध, विभिन्न अनुप्रयोगों में एकीकरण सक्षम बनाती हैं। - **कमांड लाइन इंटरफेस (CLI)**: सीधे टेक्स्ट रूपांतरण, खंडीकरण निरीक्षण और द्वंद्व संज्ञान के लिए एक नेटिव CLI टूल (`--segmentation`, `--inspect`, `--ambiguities` के साथ) - **पूर्व-निर्मित बाइनरी**: Homebrew, WinGet और Debian पैकेज जैसे पैकेज मैनेजर के माध्यम से Windows, Linux और macOS के लिए उपलब्ध। - **ऑनलाइन कन्वर्टर**: opencc.js.org पर एक वेब-आधारित इंटरफेस। OpenCC में विशिष्ट रूपांतरण मार्गों के लिए विभिन्न कॉन्फ़िगरेशन फ़ाइलें शामिल हैं, जैसे कि सरलीकृत से पारंपरिक (मानक, ताइवान, होंग कॉंग), और वाक्यांश समायोजन के साथ क्षेत्र-विशिष्ट रूपांतरण। इसमें उन्नत खंडीकरण के लिए `opencc-jieba` जैसे प्रयोगात्मक प्लगइन का भी समर्थन है। सॉफ़्टवेयर Apache License 2.0 के तहत लाइसेंस प्राप्त है और इनपुट विधियाँ (ibus-pinyin, fcitx), शब्दकोश (GoldenDict) और शोध डेटाबेस जैसे प्रोजेक्ट्स में व्यापक रूप से उपयोग किया जाता है।