Sobre o projeto
Open Chinese Convert (OpenCC) é um projeto abrangente de código aberto projetado para conversão de texto de alta qualidade entre diferentes conjuntos de caracteres chineses e convenções regionais de escrita. Suporta conversão entre chinês tradicional, chinês simplificado, shinjitai japonês (novas formas de caracteres) e preferências regionais específicas de palavras encontradas na China continental, Taiwan e Hong Kong.
Principais recursos incluem:
- Conversão determinística baseada em dicionário que não depende de Modelos de Linguagem de Grande Escala (LLMs), garantindo resultados offline estáveis, previsíveis e rápidos.
- Dicionários e bibliotecas desacoplados, permitindo modificações e extensões personalizadas.
- Distinção estrita entre mapeamentos simplificado-tradicional e mapeamentos de variantes de caracteres, aderindo ao princípio de "separar sempre que distinguível".
- Suporte para expressões idiomáticas regionais e variantes de caracteres (por exemplo, converter "鼠标" para "滑鼠").
- Suporte limitado para conversão entre shinjitai japonês e kyujitai (formas antigas de caracteres).
O projeto fornece múltiplas interfaces e ferramentas:
- **Bibliotecas**: Disponível para C++, C, Python e Node.js, permitindo integração em várias aplicações.
- **Interface de Linha de Comando (CLI)**: Uma ferramenta CLI nativa para conversão direta de texto, inspeção de segmentação e detecção de ambiguidades via modos de diagnóstico (`--segmentation`, `--inspect`, `--ambiguities`).
- **Binários Pré-compilados**: Disponível para Windows, Linux e macOS através de gerenciadores de pacotes como Homebrew, WinGet e pacotes Debian.
- **Conversor Online**: Uma interface web em opencc.js.org.
OpenCC inclui uma ampla gama de arquivos de configuração para caminhos de conversão específicos, como Simplificado para Tradicional (Padrão, Taiwan, Hong Kong), e conversões entre regiões com ajustes de frases. Também suporta plugins experimentais como `opencc-jieba` para segmentação avançada.
O software é licenciado sob a Apache License 2.0 e é amplamente usado em projetos como métodos de entrada (ibus-pinyin, fcitx), dicionários (GoldenDict) e bases de dados de pesquisa.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.