Sobre el proyecto
paperless-paddle-ocr integra PaddleOCR PP-OCRv6 con paperless-ngx como un worker externo. Sondea la API de paperless en busca de documentos que coincidan con una etiqueta de entrada configurable, los reclama con una etiqueta de procesamiento, descarga los archivos, renderiza las páginas PDF a imágenes usando PyMuPDF, ejecuta OCR y envía mediante PATCH el texto extraído al contenido del documento. Los documentos completados reciben una etiqueta de salida, mientras que los fallos reciben una etiqueta de error.
El proyecto está diseñado para uso en CPU y ofrece backends de PaddlePaddle, ONNX Runtime y OpenVINO opcional para hardware Intel. La configuración se suministra a través de variables de entorno, incluyendo la URL de paperless y el token de API, el idioma de OCR, el nivel del modelo, los DPI, el intervalo de sondeo, el número de hilos, las etiquetas de procesamiento, el comportamiento de reprocesamiento y el modo de prueba en seco. Puede ejecutarse continuamente como daemon o realizar una sola pasada.
El despliegue está documentado con Docker Compose y un comando Docker simple. La imagen se ejecuta como un usuario no root, incluye una verificación de salud y soporta linux/amd64 y linux/arm64. Los flujos de desarrollo local cubren el linting con Ruff, la verificación de tipos con mypy y pytest con dependencias pesadas de OCR simuladas.
El worker se comunica con paperless-ngx solo a través de su API HTTP y no incluye el código fuente de paperless-ngx ni de PaddleOCR. Está diseñado solo para CPU, no ha sido probado bajo carga con conjuntos muy grandes de documentos coincidentes, y los resultados de OCR dependen de la calidad del escaneo, el nivel del modelo y los ajustes de DPI. El repositorio tiene licencia MIT.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.