这个项目能做什么
PageLedger 是一个开源 Python 库和 CLI 工具,为 OCR 和文档提取运行提供可审计的页面级跟踪。它封装了文本提取和 OCR 引擎,记录每个处理页面的来源、质量信号、成本和审查状态。
核心功能包括:
- **页面级账本**:每次提取运行存储为包含 JSON、YAML、Markdown 和原始输出文件的目录——无需数据库或运行中的服务即可检查。
- **内置适配器**:开箱即用地支持纯文本文件、PDF 文本层和 Tesseract OCR。可通过适配器协议添加其他引擎。
- **预算跟踪**:记录页数、令牌使用量、耗时和成本估算,区分报告的费用与配置的限制。
- **质量信号**:为每个页面分配质量等级和警告,以帮助识别需要审查的页面。这些不是准确率分数,而是基于证据的标记。
- **审查和重新运行队列**:被标记的页面可以重新运行或保留供人工审查。`review-job` 记录与源文档绑定的审查者决策。
- **可恢复运行**:中断的运行和文档任务保留检查点证据。使用 `pageledger resume` 验证保存的响应并复用它们,无需重新提取。
- **运行比较**:`pageledger compare-runs` 支持对同一来源的不同提取尝试进行并排分析。
- **规范化记录**:`align` 可以根据声明的列和算术检查修订结构化记录(表格、JSON、CSV),而无需重新提取。
安装需要 Python 3.10+,并可在 PyPI 上获取。`pageledger[pdf]` 附加组件添加了 PDF 支持;扫描的 PDF 还需要 Poppler 和 Tesseract,可通过 `pageledger doctor` 验证。
该工具源于一个苏联人口普查数字化项目,专为需要将提取输出追溯到源页面并重建结果产生过程的档案馆、历史学家和研究团队设计。一份 60 页的验证报告记录了自动化检查能捕获的内容以及仍需要人工审查的地方。
评论
0 评分人数达到10人后显示
登录后参与讨论。