このプロジェクトについて

Open Chinese Convert (OpenCC)は、異なる漢字セットと地域的な書記慣習間の高品質なテキスト変換を目的とした包括的なオープンソースプロジェクトです。繁体字、簡体字、日本語新字体、および中国本土、台湾、香港で見られる特定の地域的な語彙の好みの間の変換をサポートしています。 主な特徴は以下の通りです: - 大規模言語モデル(LLM)に依存しない、決定的で辞書ベースの変換により、安定した予測可能で高速なオフライン結果を保証します。 - 辞書とライブラリが分離されており、カスタム修正と拡張が可能です。 - 簡体字-繁体字マッピングと文字異体字マッピングを厳密に区別し、「区別できる場合は分離する」という原則に従います。 - 地域的な慣用表現と文字異体字のサポート(例:「鼠标」を「滑鼠」に変換)。 - 日本語新字体と旧字体間の変換の限定的なサポート。 このプロジェクトは複数のインターフェースとツールを提供します: - **ライブラリ**:C++、C、Python、Node.jsで利用可能で、様々なアプリケーションへの統合が可能です。 - **コマンドラインインターフェース(CLI)**:ネイティブCLIツールで、直接のテキスト変換、セグメンテーション検査、診断モード(`--segmentation`、`--inspect`、`--ambiguities`)による曖昧性検出が可能です。 - **プリビルドバイナリ**:Homebrew、WinGet、Debianパッケージなどのパッケージマネージャーを通じて、Windows、Linux、macOSで利用可能です。 - **オンラインコンバーター**:opencc.js.orgのウェブベースインターフェース。 OpenCCには、簡体字から繁体字(標準、台湾、香港)への変換や、フレーズ調整を伴う地域間変換など、特定の変換パス用の幅広い設定ファイルが含まれています。また、高度なセグメンテーションのための`opencc-jieba`などの実験的プラグインもサポートしています。 このソフトウェアはApache License 2.0の下でライセンスされており、入力メソッド(ibus-pinyin、fcitx)、辞書(GoldenDict)、研究データベースなどのプロジェクトで広く使用されています。