Об этом проекте

Watermark Cleaner — это детерминированный, автономный инструмент командной строки без зависимостей для очистки контента, который вы владеете, перед публикацией. Он удаляет механические следы, которые могут маркировать текст как сгенерированный машиной, отмечает стилистические фразы AI и удаляет идентифицирующие метаданные из поддерживаемых форматов изображений и документов, не изменяя пиксели или законный текст. Проект включает в себя CLI для Python и CLI для Node, которые используют один и тот же набор правил и были протестированы на идентичное поведение. Инструмент может сканировать файлы или папки с помощью команды check, которая сообщает о находках, не изменяя ничего, и завершается с ненулевым кодом, если присутствуют блокирующие проблемы, что делает его подходящим в качестве шлюза для публикации. Команда fix очищает файлы на месте и создает резервную копию .bak рядом с измененными файлами. Он поддерживает очистку невидимых юникодов, нормализацию типографии, обнаружение фраз AI и безпотерное удаление метаданных для JPEG, PNG, WebP, SVG, DOCX и ODT. Метаданные GIF и TIFF сообщаются, но не изменяются, а поддержка PDF пока недоступна. Он осторожен в том, что сохраняет: нулевые соединители и не-соединители, необходимые для эмодзи или скриптов справа налево, элементы управления bidi в документах RTL, неразрывные пробелы в числах и аббревиатурах, селекторы вариаций и подлинный кириллический или греческий текст сохраняются, если не используется агрессивный режим. Блоки кода Markdown и YAML-фронтматерия защищены от правил типографии и голоса, в то время как скрытые символы внутри кода все еще удаляются в качестве защиты от атак типа Trojan Source. Проект можно установить через pipx, npm, uvx, npx или из исходного кода, и его можно интегрировать с pre-commit, git-хуками или шлюзами развертывания. Конфигурация предоставляется через JSON-файл, позволяя пользователям контролировать правила голоса, обработку гомоглифов, замену тире, запрещенные фразы, игнорируемые фразы, поддерживаемые текстовые расширения и исключенные пути. Доступна опциональная команда переписывания DeepL для статистического разрушения водяных знаков, но она отключена по умолчанию и отправляет текст в DeepL, поэтому ее не следует использовать с конфиденциальным контентом. Watermark Cleaner явно не является детектором или инструментом сертификации. Он не удаляет пиксельные водяные знаки, бэкдоры во время обучения или статистические водяные знаки на уровне токенов детерминистически. Его цель — гигиена, конфиденциальность и прозрачность: инспектировать скрытый контент, удалять нежелательные машинные отпечатки и публиковать более чистые файлы.