Об этом проекте

Open Chinese Convert (OpenCC) — это комплексный проект с открытым исходным кодом, предназначенный для высококачественного преобразования текста между различными наборами китайских иероглифов и региональными письменными нормами. Он поддерживает преобразование между традиционным китайским, упрощенным китайским, японским синдзитай (новые формы иероглифов) и специфическими региональными предпочтениями в словоупотреблении, встречающимися в материковом Китае, на Тайване и в Гонконге. Ключевые особенности включают: - Детерминированное преобразование на основе словарей, не полагающееся на большие языковые модели (LLM), что обеспечивает стабильные, предсказуемые и быстрые результаты в автономном режиме. - Раздельные словари и библиотеки, что позволяет вносить пользовательские изменения и расширения. - Строгое различие между сопоставлениями упрощенный-традиционный и сопоставлениями вариантов иероглифов, придерживаясь принципа «разделять, когда различимо». - Поддержка региональных идиоматических выражений и вариантов иероглифов (например, преобразование «鼠标» в «滑鼠»). - Ограниченная поддержка преобразования между японским синдзитай и кюдзитай (старые формы иероглифов). Проект предоставляет несколько интерфейсов и инструментов: - **Библиотеки**: доступны для C++, C, Python и Node.js, что позволяет интегрировать их в различные приложения. - **Интерфейс командной строки (CLI)**: нативный инструмент CLI для прямого преобразования текста, проверки сегментации и обнаружения неоднозначностей через диагностические режимы (`--segmentation`, `--inspect`, `--ambiguities`). - **Готовые бинарные файлы**: доступны для Windows, Linux и macOS через менеджеры пакетов, такие как Homebrew, WinGet и пакеты Debian. - **Онлайн-конвертер**: веб-интерфейс на opencc.js.org. OpenCC включает широкий спектр файлов конфигурации для конкретных путей преобразования, таких как упрощенный в традиционный (стандартный, тайваньский, гонконгский), а также межрегиональные преобразования с корректировкой фраз. Также поддерживаются экспериментальные плагины, такие как `opencc-jieba`, для расширенной сегментации. Программное обеспечение распространяется под лицензией Apache License 2.0 и широко используется в таких проектах, как методы ввода (ibus-pinyin, fcitx), словари (GoldenDict) и исследовательские базы данных.