इस प्रोजेक्ट के बारे में
PaddleOCR, PaddlePaddle द्वारा विकसित एक व्यापक OCR और डकुमेंट AI टूलकिट है। यह PDF दस्तावेज़ों और छवियों को JSON या Markdown प्रारूप में संरचित, LLM-तैयार डेटा में परिवर्तित करता है।
प्रमुख घटक:
- PP-OCRv6: एक बहुभाषी पाठ पहचान मॉडल जो एक एकीकृत मॉडल में 50+ भाषाओं का समर्थन करता है, जिसमें चीनी, अंग्रेजी, जापानी और 46 लैटिन-लिपि भाषाएं शामिल हैं। इसमें 100+ भाषाओं में कुल मिलाकर सिरिलिक, अरब, देवनागरी और अन्य लिपियां भी शामिल हैं। इसे किनारे, मोबाइल और सर्वर डिप्लॉयमेंट के लिए तीन आकार श्रेणियों (tiny 1.5M, small 7.7M, medium 34.5M पैरामीटर) में उपलब्ध कराया गया है।
- PaddleOCR-VL: दस्तावेज़ पार्सिंग के लिए एक विज़न-लैंग्वेज मॉडल (0.9B पैरामीटर)। यह OmniDocBench जैसे बैेंचमार्कों पर मजबूत परिणाम प्राप्त करता है और टेक्स्ट, सूत्रों, तालिकाओं, चार्टों, प्राचीन दस्तावेज़ों, सीलों और दुर्लभ वर्णों को संभालता है। निर्देशांक जानकारी के साथ संरचित Markdown और JSON आउटपुट करता है।
- PP-StructureV3: एक संरचना-जागरूक दस्तावेज़ रूपांतरण पाइपलाइन जो तालिका कोशिकाओं, पाठ क्षेत्रों और अन्य लेआउट तत्वों के लिए सूक्ष्म-स्तर की निर्देशांक जानकारी प्रदान करती है।
- HPD-Parsing: उच्च-थ्रूपुट दस्तावेज़ पार्सिंग के लिए एक हल्का विज़न-लैंग्वेज मॉडल जिसमें हियरार्किकल पैरेलल डीकोडिंग का समर्थन है।
यह टूलकिट NVIDIA GPU, Intel CPU, Kunlunxin XPU और विभिन्न AI एक्सेलेरेटर सहित कई हार्डवेयर बैकएंड का समर्थन करता है। इसे ONNX, OpenVINO, TensorRT के माध्यम से डिप्लॉय किया जा सकता है या HTTP API के रूप में सेवा दी जा सकती है। PaddleOCR को Dify, RAGFlow, Pathway और Cherry Studio जैसे AI एप्लिकेशन प्लेटफॉर्म के साथ एकीकृत किया गया है।
एक आधिकारिक ब्राउज़र इन्फरेंस SDK, PaddleOCR.js, ब्राउज़र में सीधे PP-OCR मॉडल चलाने की अनुमति देता है। यह प्रोजेक्ट Word, Excel और PowerPoint दस्तावेज़ों को Markdown में परिवर्तित करने और पार्स्ड परिणामों को DOCX प्रारूप में निर्यात करने का भी समर्थन करता है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.