Sobre o projeto
PageLedger é uma biblioteca Python de código aberto e ferramenta CLI que oferece rastreamento auditável em nível de página para execuções de extração de documentos e OCR. Ela funciona como uma camada sobre motores de extração de texto e OCR, registrando proveniência, sinais de qualidade, custos e estado de revisão para cada página processada.
Principais funcionalidades incluem:
- **Ledgers em nível de página**: Cada execução de extração é armazenada como um diretório de arquivos JSON, YAML, Markdown e saídas brutas — inspecionáveis sem necessidade de banco de dados ou serviço em execução.
- **Adaptadores integrados**: Suporta arquivos de texto simples, camadas de texto de PDF e OCR Tesseract nativamente. Motores adicionais podem ser adicionados por meio do protocolo de adaptadores.
- **Rastreamento de orçamento**: Registra contagem de páginas, uso de tokens, tempo decorrido e estimativas de custo, diferenciando cobranças reportadas de limites configurados.
- **Sinais de qualidade**: Atribui notas de qualidade e avisos por página para ajudar a identificar páginas que precisam de revisão. Esses não são escores de precisão, mas sinalizações baseadas em evidências.
- **Filas de revisão e reexecução**: Páginas sinalizadas podem ser reexecutadas ou retidas para revisão humana. Os registros de `review-job` contêm as decisões dos revisores vinculadas ao documento de origem.
- **Execuções retomáveis**: Execuções interrompidas e trabalhos de documento mantêm evidências de checkpoint. Use `pageledger resume` para verificar as respostas salvas e reutilizá-las sem necessidade de reextrair o conteúdo.
- **Comparação de execuções**: O comando `pageledger compare-runs` permite a análise lado a lado de diferentes tentativas de extração na mesma fonte.
- **Registros normalizados**: O comando `align` pode revisar registros estruturados (tabelas, JSON, CSV) de acordo com colunas declaradas e verificações aritméticas, sem necessidade de reextração.
A instalação requer Python 3.10 ou superior e está disponível no PyPI. O extra `pageledger[pdf]` adiciona suporte a PDF; PDFs digitalizados exigem adicionalmente Poppler e Tesseract, que podem ser verificados com o comando `pageledger doctor`.
A ferramenta se originou de um projeto de digitalização de censo soviético e é projetada para arquivos, historiadores e equipes de pesquisa que precisam rastrear a saída extraída de volta às páginas de origem e reconstruir como os resultados foram produzidos. Um relatório de validação de 60 páginas documenta o que as verificações automatizadas detectam e onde a revisão humana ainda é necessária.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.