Tesseract एक ओपन-सोर्स OCR इंजन है जो 100 से अधिक भाषाओं में छवियों में टेक्स्ट पहचानने के लिए एक कमांड-लाइन टूल और लाइब्रेरी प्रदान करता है।
ओपन सोर्स। नई संभावनाएँ।
उत्कृष्ट ओपन-सोर्स प्रोजेक्ट खोजें, गुमनाम रूप से प्रोजेक्ट सबमिट करें और अपने प्रोजेक्ट का दावा कर उसे संपादित करें।
जिज्ञासा के साथ ओपन सोर्स खोजें।
THE FIRST COLLECTIONPageLedger एक ओपन-सोर्स Python CLI लाइब्रेरी है जो OCR और दस्तावेज़ निष्कर्षण के लिए पृष्ठ-स्तर पर पत्रपुस्तकीय, गुणवत्ता संकेत और बजट ट्रैकिंग प्रदान करती है। यह निरंतर रन, पुनरीक्षण कतारें और मानव-में-लूप सत्यापन का समर्थन करती है।
Tesseract.js is a JavaScript OCR library that extracts text from images in over 100 languages. It runs in browsers via WebAssembly and on Node.js, wrapping the Tesseract engine without modifying its recognition model.
OCRmyPDF एक कमांड-लाइन टूल है जो स्कैन किए गए PDF फ़ाइलों में खोजने योग्य OCR टेक्स्ट लेयर जोड़ता है और वैध PDF/A आउटपुट उत्पन्न करता है। यह 100+ भाषाओं में पहचान के लिए Tesseract का उपयोग करता है, डेस्क्यू और रोटेशन सुधार का समर्थन करता है, और Linux, macOS, Windows, FreeBSD पर चलता है।