PaddleOCR एक ओपन-सोर्स OCR टूलकिट है जो PDFs और images को LLMs के लिए JSON/Markdown में संरचित डेटा में बदलता है। इसमें PP-OCRv6 (100+ भाषाओं के लिए), PaddleOCR-VL, और PP-StructureV3 शामिल हैं।
ओपन सोर्स। नई संभावनाएँ।
उत्कृष्ट ओपन-सोर्स प्रोजेक्ट खोजें, गुमनाम रूप से प्रोजेक्ट सबमिट करें और अपने प्रोजेक्ट का दावा कर उसे संपादित करें।
जिज्ञासा के साथ ओपन सोर्स खोजें।
THE FIRST COLLECTIONTesseract एक ओपन-सोर्स OCR इंजन है जो 100 से अधिक भाषाओं में छवियों में टेक्स्ट पहचानने के लिए एक कमांड-लाइन टूल और लाइब्रेरी प्रदान करता है।
PageLedger एक ओपन-सोर्स Python CLI लाइब्रेरी है जो OCR और दस्तावेज़ निष्कर्षण के लिए पृष्ठ-स्तर पर पत्रपुस्तकीय, गुणवत्ता संकेत और बजट ट्रैकिंग प्रदान करती है। यह निरंतर रन, पुनरीक्षण कतारें और मानव-में-लूप सत्यापन का समर्थन करती है।
MinerU एक ओपन-सोर्स डॉक्यूमेंट पार्सिंग इंजन है जो PDF, इमेज, DOCX, PPTX और XLSX को LLM, RAG और एजेंट वर्कफ़्लो के लिए संरचित Markdown/JSON में बदलता है। यह VLM+OCR डुअल इंजन, 109 भाषाओं का OCR और प्राइवेट/ऑफ़लाइन डिप्लॉयमेंट सपोर्ट करता है।
Tesseract.js is a JavaScript OCR library that extracts text from images in over 100 languages. It runs in browsers via WebAssembly and on Node.js, wrapping the Tesseract engine without modifying its recognition model.
EasyOCR एक तैयार-उपयोग ऑप्टिकल कैरेक्टर पहचान लाइब्रेरी है जो 80+ भाषाओं और प्रमुख लेखन लिपियों का समर्थन करती है। यह सरल Python API और CLI प्रदान करती है, जिसमें PyTorch-आधारित डिटेक्शन और रिकग्निशन मॉडल शामिल हैं, साथ ही कस्टम प्रशिक्षण के विकल्प भी हैं।
X-AnyLabeling एक क्रॉस-प्लेटफ़ॉर्म डेस्कटॉप एप्लिकेशन है जो इमेज, वीडियो, टेक्स्ट और मल्टीमोडल डेटा की AI-सहायता प्राप्त एनोटेशन के लिए बनाया गया है। इसमें कई बिल्ट-इन डीप लर्निंग मॉडल, विविध लेबलिंग टूल्स और अनेक फ़ॉर्मेट इम्पोर्ट/एक्सपोर्ट समर्थित हैं।
AksharaMD एक स्थानीय, पार्सर-अज्ञेयवादी उपकरण है जो मूल्यांकन करता है कि चुने गए दस्तावेज़ पार्सर ने स्रोत फ़ाइल को AI-अनुकूल Markdown में कितनी अच्छी तरह बदला, प्रति-दस्तावेज़ तत्परता स्कोर, ब्लॉक-स्तरीय उत्पत्ति टैग, नामित चेतावनियाँ, और वैकल्पिक स्रोत-आधारित ACCEPT/REJECT निर्णय लौटाता है।