Sobre o projeto

Open Chinese Convert (OpenCC) é um projeto abrangente de código aberto projetado para conversão de texto de alta qualidade entre diferentes conjuntos de caracteres chineses e convenções regionais de escrita. Suporta conversão entre chinês tradicional, chinês simplificado, shinjitai japonês (novas formas de caracteres) e preferências regionais específicas de palavras encontradas na China continental, Taiwan e Hong Kong. Principais recursos incluem: - Conversão determinística baseada em dicionário que não depende de Modelos de Linguagem de Grande Escala (LLMs), garantindo resultados offline estáveis, previsíveis e rápidos. - Dicionários e bibliotecas desacoplados, permitindo modificações e extensões personalizadas. - Distinção estrita entre mapeamentos simplificado-tradicional e mapeamentos de variantes de caracteres, aderindo ao princípio de "separar sempre que distinguível". - Suporte para expressões idiomáticas regionais e variantes de caracteres (por exemplo, converter "鼠标" para "滑鼠"). - Suporte limitado para conversão entre shinjitai japonês e kyujitai (formas antigas de caracteres). O projeto fornece múltiplas interfaces e ferramentas: - **Bibliotecas**: Disponível para C++, C, Python e Node.js, permitindo integração em várias aplicações. - **Interface de Linha de Comando (CLI)**: Uma ferramenta CLI nativa para conversão direta de texto, inspeção de segmentação e detecção de ambiguidades via modos de diagnóstico (`--segmentation`, `--inspect`, `--ambiguities`). - **Binários Pré-compilados**: Disponível para Windows, Linux e macOS através de gerenciadores de pacotes como Homebrew, WinGet e pacotes Debian. - **Conversor Online**: Uma interface web em opencc.js.org. OpenCC inclui uma ampla gama de arquivos de configuração para caminhos de conversão específicos, como Simplificado para Tradicional (Padrão, Taiwan, Hong Kong), e conversões entre regiões com ajustes de frases. Também suporta plugins experimentais como `opencc-jieba` para segmentação avançada. O software é licenciado sob a Apache License 2.0 e é amplamente usado em projetos como métodos de entrada (ibus-pinyin, fcitx), dicionários (GoldenDict) e bases de dados de pesquisa.