Sobre o projeto

Watermark Cleaner é uma ferramenta de linha de comando determinística, offline e sem dependências para limpar conteúdo próprio antes da publicação. Ela remove traços mecânicos que podem marcar o texto como gerado por máquina, sinaliza frases estilísticas de IA e remove metadados de identificação de formatos de imagem e documento suportados, sem alterar pixels ou texto legítimo. O projeto inclui uma CLI em Python e uma CLI em Node que compartilham o mesmo conjunto de regras e são testadas para se comportarem de forma idêntica. A ferramenta pode analisar arquivos ou pastas com o comando check, que relata descobertas sem fazer alterações e sai com um código de erro não zero quando há problemas de bloqueio, tornando-a adequada como uma porta de publicação. O comando fix limpa no local e escreve um backup .bak ao lado dos arquivos alterados. Ela suporta limpeza de Unicode invisível, normalização de tipografia, detecção de frases de IA e remoção de metadados sem perdas para JPEG, PNG, WebP, SVG, DOCX e ODT. Metadados de GIF e TIFF são relatados, mas não modificados, e o suporte a PDF ainda não está disponível. Ela é cuidadosa com o que preserva: zero width joiners e non-joiners necessários para emojis ou scripts da direita para a esquerda, controles bidi em documentos RTL, espaços não quebráveis em números e abreviações, seletores de variação e texto genuíno em cirílico ou grego são mantidos, a menos que um modo agressivo seja usado. Blocos de código Markdown e frontmatter YAML são protegidos de regras de tipografia e voz, enquanto caracteres ocultos dentro do código ainda são removidos como defesa contra ataques do tipo Trojan Source. O projeto pode ser instalado via pipx, npm, uvx, npx ou a partir do código-fonte, e pode ser integrado com pre-commit, hooks do git ou gates de implantação. A configuração é fornecida por meio de um arquivo JSON, permitindo aos usuários controlar regras de voz, tratamento de homógrafos, substituição de traços, frases banidas, frases ignoradas, extensões de texto suportadas e caminhos excluídos. Um comando opcional de reescrita DeepL está disponível para degradação de marcas d'água estatísticas, mas está desativado por padrão e envia texto para o DeepL, portanto, não deve ser usado com conteúdo confidencial. Watermark Cleaner não é um detector ou uma ferramenta de certificação. Ela não remove marcas d'água de domínio de pixel, backdoors de treinamento ou marcas d'água estatísticas de nível de token de forma determinística. Seu propósito é higiene, privacidade e transparência: inspecionar conteúdo oculto, remover impressões digitais de máquina indesejadas e publicar arquivos mais limpos.