Об этом проекте

PageLedger — это библиотека Python с открытым исходным кодом и инструмент CLI, обеспечивающий аудируемое постраничное отслеживание запусков OCR и извлечения документов. Она оборачивает движки извлечения текста и OCR, фиксируя происхождение, сигналы качества, затраты и состояние проверки для каждой обработанной страницы. Ключевые возможности включают: - Постраничные журналы: каждый запуск извлечения сохраняется как каталог файлов JSON, YAML, Markdown и необработанных выходных данных, доступный для просмотра без базы данных или работающего сервиса. - Встроенные адаптеры: из коробки поддерживаются текстовые файлы, текстовые слои PDF и Tesseract OCR. Дополнительные движки можно добавить через протокол адаптера. - Учёт бюджета: фиксирует количество страниц, использование токенов, затраченное время и оценки стоимости, различая заявленные расходы и заданные лимиты. - Сигналы качества: присваивает постраничные оценки качества и предупреждения, помогающие выявить страницы, требующие проверки. Это не показатели точности, а флаги на основе свидетельств. - Очереди проверки и перезапуска: помеченные страницы можно перезапустить или отложить для проверки человеком. review-job записывает решения проверяющего, привязанные к исходному документу. - Возобновляемые запуски: прерванные запуски и задания по документам сохраняют контрольные свидетельства. Используйте pageledger resume, чтобы проверить сохранённые ответы и повторно использовать их без повторного извлечения. - Сравнение запусков: pageledger compare-runs позволяет сопоставлять разные попытки извлечения из одного источника. - Нормализованные записи: align может корректировать структурированные записи (таблицы, JSON, CSV) по объявленным столбцам и арифметическим проверкам без повторного извлечения. Для установки требуется Python 3.10+; пакет доступен на PyPI. Дополнение pageledger[pdf] добавляет поддержку PDF; для отсканированных PDF дополнительно требуются Poppler и Tesseract, проверить которые можно с помощью pageledger doctor. Инструмент возник в рамках проекта оцифровки советской переписи населения и предназначен для архивов, историков и исследовательских групп, которым нужно проследить извлечённые данные до исходных страниц и восстановить, как были получены результаты. Отчёт о валидации на 60 страниц документирует, что улавливают автоматические проверки и где по-прежнему необходим человеческий контроль.