这个项目能做什么

ClaudeMark是一款本地优先、零外出的取证工具包,用于检查和清理您拥有的文本与文件中的AI水印和来源数据。它采用Python(3.10+,使用标准库)实现,可离线运行,核心操作不发起任何出站网络调用,采用MIT许可证发行。 检测与清理分为多个层次。A层为确定性文本处理:扫描零宽空格、ZWNJ、ZWJ、单词连接符、BOM、蒙古语元音分隔符、Unicode标签、变体选择器、双向覆盖符、异常空格和同形字符等不可见Unicode载体,并将隐藏标记渲染为可读标签(如ZWSP、BOM、RLO)以便检查。B层为统计分析:README中描述了Claude研究启发式检测器、Kirchenbauer类红绿列表偏置检测器、SynthID风格检测器和通用检测器,以及尽力而为的改写或干扰通行,附带改写前后的评估和并排HTML差异报告。 对于文件和容器,它检查和剥离C2PA/JUMBF清单、EXIF、XMP、IPTC、文档XML元数据和生成器签名。已记录的格式覆盖包括PNG、JPEG、WebP、SVG、AVIF、HEIC、PDF、DOCX、ODT、HTML和Markdown,格式表中还列出了MP4/MOV/M4A和MP3标签处理。清理操作以原子方式写入输出。可选宿主工具——c2patool用于C2PA验证、exiftool用于次要元数据检查、qpdf用于结构化的PDF对象重建——在可用时调用。 工具包内置防御性安全扫描功能,涵盖解压缩炸弹(压缩比上限100倍、解压后上限100MB)、恶意PDF动作(如/JavaScript、/JS、/Launch、/EmbeddedFiles和/SubmitForm)、嵌入式VBA宏项目,以及路径穿越和Windows保留设备名防护。面向文本的命令通过验证文件签名和控制字节分布来拒绝二进制输入,防止文件损坏。 工具包提供多种接口。CLI包含analyze、unicode inspect/visualize/clean、rewrite、evaluate、diff、inspect、clean、audit、evidence、schema、c2pa inspect、security scan、agent list/exec、serve、doctor和benchmark子命令,目录清理支持干跑模式。标准库HTTP服务提供Web仪表板和REST API(health、capabilities、OpenAPI规范、inspect、clean、analyze、unicode analyze/visualize、rewrite、evaluate、diff、security scan、agent tools/exec),支持通过环境变量配置可选的Bearer Token认证。MCP stdio服务器(claudemark-mcp)通过initialize、tools/list和tools/call在本地暴露相同的工具。通过安装脚本可为Claude、Cursor、Antigravity、Grok和Codex安装Skill和规则文件。 自动化集成包括生成OASIS SARIF 2.1.0输出以用于GitHub代码扫描(支持--fail-on选项)、用于Unicode清理和仓库审计的官方pre-commit钩子,以及以只读根文件系统和非root用户运行的Docker Compose打包。证据包为ZIP文件,内含规范化JSON报告和SHA-256清单;是否包含原始文件为可选,验证模式检查报告哈希及(若存在)嵌入原始文件的哈希。文档指出,证据包证明其内容的完整性,但不构成加密签名或作者身份声明。 项目明确声明了范围限制。统计信号不能证明AI作者身份;该项目声称无法访问专有模型权重、私有供应商水印密钥或未公开的供应商检测API;统计干扰仅为尽力而为,分数较低并不能保证擦除成功或在其他系统得出不同分类;缺少元数据也不能证明内容为人类创作或无来源信息。像素域水印适配器(SynthID-Image、CtrlRegen、MarkDiffusion、Tree-Ring、Stable Signature、StegaStamp)为研究接口而非捆绑模型,在配置检查点之前会报告为不可用。此外还描述了与MarkLLM评估框架的集成点,供受控实验使用。