À propos du projet

Watermark Cleaner est un outil déterministe, hors ligne, sans dépendance, pour nettoyer le contenu que vous possédez avant publication. Il supprime les traces mécaniques qui peuvent marquer le texte comme étant généré par machine, signale les phrases stylistiques AI et supprime les métadonnées identificatives des formats d'image et de document pris en charge sans altérer les pixels ni le texte légitime. Le projet fournit un CLI Python et un CLI Node qui partagent un ensemble de règles et sont testés pour se comporter de manière identique. L'outil peut scanner des fichiers ou des dossiers avec la commande check, qui rapporte les résultats sans modifier quoi que ce soit et quitte avec une valeur non nulle lorsque des problèmes bloquants sont présents, ce qui le rend adapté comme passerelle de publication. La commande fix nettoie en place et écrit une sauvegarde .bak à côté des fichiers modifiés. Il prend en charge le nettoyage des caractères Unicode invisibles, la normalisation de la typographie, la détection des phrases AI et la suppression sans perte des métadonnées pour JPEG, PNG, WebP, SVG, DOCX et ODT. Les métadonnées GIF et TIFF sont signalées mais non modifiées, et la prise en charge des PDF n'est pas encore disponible. Il est prudent quant à ce qu'il préserve : les jointures et non-jointures à largeur nulle nécessaires aux émojis ou aux scripts de droite à gauche, les contrôles bidi dans les documents RTL, les espaces non cassables dans les nombres et les abréviations, les sélecteurs de variation et le texte cyrillique ou grec authentique sont conservés à moins qu'un mode agressif ne soit utilisé. Les blocs de code Markdown et les frontmatter YAML sont protégés contre les règles de typographie et de voix, tandis que les caractères cachés à l'intérieur du code sont toujours supprimés comme défense contre les attaques de type Trojan Source. Le projet peut être installé via pipx, npm, uvx, npx ou à partir du code source, et peut être intégré avec pre-commit, des hooks git ou des passerelles de déploiement. La configuration est fournie via un fichier JSON, permettant aux utilisateurs de contrôler les règles de voix, la gestion des homoglyphes, le remplacement des tirets, les phrases interdites, les phrases ignorées, les extensions de texte prises en charge et les chemins exclus. Une commande de réécriture DeepL facultative est disponible pour la dégradation statistique des filigranes, mais elle est désactivée par défaut et envoie le texte à DeepL, elle ne doit donc pas être utilisée avec du contenu confidentiel. Watermark Cleaner n'est explicitement pas un outil de détection ou de certification. Il ne supprime pas les filigranes d'image du domaine des pixels, les backdoors de l'entraînement ou les filigranes statistiques au niveau des jetons de manière déterministe. Son objectif est l'hygiène, la confidentialité et la transparence : inspecter le contenu caché, supprimer les empreintes digitales machine indésirables et publier des fichiers plus propres.