À propos du projet

Open Chinese Convert (OpenCC) est un projet open-source complet conçu pour la conversion de texte de haute qualité entre différents ensembles de caractères chinois et conventions d'écriture régionales. Il prend en charge les conversions entre le chinois traditionnel, le chinois simplifié, le Shinjitai japonais (nouvelles formes de caractères) et les préférences de vocabulaire spécifiques à la Chine continentale, Taïwan et Hong Kong. Les fonctionnalités clés incluent : - Une conversion déterministe basée sur des dictionnaires, qui ne repose pas sur des modèles de langage larges (LLM), garantissant des résultats stables, prévisibles et rapides hors ligne. - Des dictionnaires et des bibliothèques découplés, permettant des modifications et extensions personnalisées. - Une distinction stricte entre les mappages simplifié-traditionnel et les mappages de variantes de caractères, adhérant au principe de « séparer chaque fois que possible ». - La prise en charge des expressions idiomatiques régionales et des variantes de caractères (par exemple, convertir « souris » en « souris » selon les régions). - Un support limité pour la conversion entre le Shinjitai et le Kyujitai japonais (anciennes formes de caractères). Le projet fournit plusieurs interfaces et outils : - **Bibliothèques** : Disponibles pour C++, C, Python et Node.js, permettant l'intégration dans diverses applications. - **Interface en ligne de commande (CLI)** : Un outil CLI natif pour la conversion directe de texte, l'inspection du segmentement et la détection des ambiguïtés via des modes diagnostiques (`--segmentation`, `--inspect`, `--ambiguities`). - **Binaires précompilés** : Disponibles pour Windows, Linux et macOS via des gestionnaires de paquets comme Homebrew, WinGet et les packages Debian. - **Convertisseur en ligne** : Une interface web disponible sur opencc.js.org. OpenCC comprend une large gamme de fichiers de configuration pour des chemins de conversion spécifiques, tels que Simplifié vers Traditionnel (Standard, Taïwan, Hong Kong), et des conversions inter-régionales avec ajustements de phrases. Il prend également en charge des plugins expérimentaux comme `opencc-jieba` pour un segmentement avancé. Le logiciel est sous licence Apache 2.0 et est largement utilisé dans des projets tels que les méthodes de saisie (ibus-pinyin, fcitx), les dictionnaires (GoldenDict) et les bases de données de recherche.