Об этом проекте
PageLedger — это библиотека Python с открытым исходным кодом и инструмент CLI, обеспечивающий аудируемое постраничное отслеживание запусков OCR и извлечения документов. Она оборачивает движки извлечения текста и OCR, фиксируя происхождение, сигналы качества, затраты и состояние проверки для каждой обработанной страницы.
Ключевые возможности включают:
- Постраничные журналы: каждый запуск извлечения сохраняется как каталог файлов JSON, YAML, Markdown и необработанных выходных данных, доступный для просмотра без базы данных или работающего сервиса.
- Встроенные адаптеры: из коробки поддерживаются текстовые файлы, текстовые слои PDF и Tesseract OCR. Дополнительные движки можно добавить через протокол адаптера.
- Учёт бюджета: фиксирует количество страниц, использование токенов, затраченное время и оценки стоимости, различая заявленные расходы и заданные лимиты.
- Сигналы качества: присваивает постраничные оценки качества и предупреждения, помогающие выявить страницы, требующие проверки. Это не показатели точности, а флаги на основе свидетельств.
- Очереди проверки и перезапуска: помеченные страницы можно перезапустить или отложить для проверки человеком. review-job записывает решения проверяющего, привязанные к исходному документу.
- Возобновляемые запуски: прерванные запуски и задания по документам сохраняют контрольные свидетельства. Используйте pageledger resume, чтобы проверить сохранённые ответы и повторно использовать их без повторного извлечения.
- Сравнение запусков: pageledger compare-runs позволяет сопоставлять разные попытки извлечения из одного источника.
- Нормализованные записи: align может корректировать структурированные записи (таблицы, JSON, CSV) по объявленным столбцам и арифметическим проверкам без повторного извлечения.
Для установки требуется Python 3.10+; пакет доступен на PyPI. Дополнение pageledger[pdf] добавляет поддержку PDF; для отсканированных PDF дополнительно требуются Poppler и Tesseract, проверить которые можно с помощью pageledger doctor.
Инструмент возник в рамках проекта оцифровки советской переписи населения и предназначен для архивов, историков и исследовательских групп, которым нужно проследить извлечённые данные до исходных страниц и восстановить, как были получены результаты. Отчёт о валидации на 60 страниц документирует, что улавливают автоматические проверки и где по-прежнему необходим человеческий контроль.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.