इस प्रोजेक्ट के बारे में

paperless-paddle-ocr, PaddleOCR PP-OCRv6 को paperless-ngx के साथ एक बाहरी वर्कर के रूप में एकीकृत करता है। यह कॉन्फ़िगर करने योग्य इनपुट टैग से मेल खाने वाले दस्तावेज़ों के लिए paperless API को पोल करता है, उन्हें एक प्रोसेसिंग टैग के साथ क्लेम करता है, फ़ाइलें डाउनलोड करता है, PyMuPDF का उपयोग करके PDF पृष्ठों को छवियों में रेंडर करता है, OCR चलाता है, और निकाले गए टेक्स्ट को दस्तावेज़ सामग्री में PATCH करता है। पूर्ण हुए दस्तावेज़ों को एक आउटपुट टैग मिलता है, जबकि विफलताओं को एक त्रुटि टैग मिलता है। यह परियोजना CPU उपयोग के लिए डिज़ाइन की गई है और Intel हार्डवेयर के लिए PaddlePaddle, ONNX Runtime, और वैकल्पिक OpenVINO बैकएंड प्रदान करती है। कॉन्फ़िगरेशन पर्यावरण चर के माध्यम से प्रदान किया जाता है, जिसमें paperless URL और API टोकन, OCR भाषा, मॉडल टियर, DPI, पोलिंग अंतराल, थ्रेड संख्या, प्रोसेसिंग टैग, पुनःप्रसंस्करण व्यवहार, और ड्राई-रन मोड शामिल हैं। यह एक डेमन के रूप में लगातार चल सकता है या एकल पास कर सकता है। परिनियोजन को Docker Compose और एक सादे Docker कमांड के साथ प्रलेखित किया गया है। इमेज एक गैर-रूट उपयोगकर्ता के रूप में चलती है, इसमें एक हेल्थ चेक शामिल है, और linux/amd64 और linux/arm64 का समर्थन करती है। स्थानीय विकास वर्कफ़्लो में Ruff लिंटिंग, mypy प्रकार जाँच, और भारी OCR निर्भरताओं के साथ pytest शामिल हैं। यह वर्कर paperless-ngx के साथ केवल उसके HTTP API के माध्यम से संचार करता है और paperless-ngx या PaddleOCR स्रोत कोड को बंडल नहीं करता है। यह डिज़ाइन से केवल CPU है, बहुत बड़े मेल खाने वाले दस्तावेज़ों के सेट के साथ लोड-टेस्ट नहीं किया गया है, और OCR परिणाम स्कैन गुणवत्ता, मॉडल टियर, और DPI सेटिंग्स पर निर्भर करते हैं। रिपॉजिटरी MIT लाइसेंस प्राप्त है।