Sobre el proyecto

Open Chinese Convert (OpenCC) es un proyecto integral de código abierto diseñado para la conversión de texto de alta calidad entre diferentes conjuntos de caracteres chinos y convenciones de escritura regionales. Soporta la conversión entre chino tradicional, chino simplificado, shinjitai japonés (nuevas formas de caracteres) y preferencias de redacción específicas encontradas en China continental, Taiwán y Hong Kong. Características clave: - Conversión determinista basada en diccionarios que no depende de Modelos de Lenguaje Grande (LLMs), garantizando resultados estables, predecibles y rápidos sin conexión a internet. - Diccionarios y bibliotecas desacoplados, permitiendo modificaciones y extensiones personalizadas. - Distinción estricta entre mapeos simplificado-tradicional y mapeos de variantes de caracteres, adherirse al principio de "separar siempre que sea distinguible". - Soporte para expresiones idiomáticas regionales y variantes de caracteres (por ejemplo, convertir "鼠标" a "滑鼠"). - Soporte limitado para la conversión entre shinjitai japonés y kyujitai (formas antiguas de caracteres). El proyecto proporciona múltiples interfaces y herramientas: - **Bibliotecas**: Disponibles para C++, C, Python y Node.js, lo que permite su integración en diversas aplicaciones. - **Interfaz de Línea de Comandos (CLI)**: Una herramienta CLI nativa para la conversión directa de texto, inspección de segmentación y detección de ambigüedades mediante modos de diagnóstico (`--segmentation`, `--inspect`, `--ambiguities`). - **Binarios preconstruidos**: Disponibles para Windows, Linux y macOS a través de gestores de paquetes como Homebrew, WinGet y paquetes Debian. - **Convertidor en línea**: Una interfaz web en opencc.js.org. OpenCC incluye una amplia gama de archivos de configuración para rutas de conversión específicas, como Simplificado a Tradicional (Estándar, Taiwán, Hong Kong), y conversiones transregionales con ajustes de frases. También soporta plugins experimentales como `opencc-jieba` para una segmentación avanzada. El software está licenciado bajo la Licencia Apache 2.0 y es ampliamente utilizado en proyectos como métodos de entrada (ibus-pinyin, fcitx), diccionarios (GoldenDict) y bases de datos de investigación.