इस प्रोजेक्ट के बारे में
pdf-inspector एक Rust लाइब्रेरी है जिसे Firecrawl ने तेज़ PDF वर्गीकरण और टेक्स्ट निष्कर्षण के लिए बनाया है। यह पता लगाता है कि PDF टेक्स्ट-आधारित है, स्कैन किया गया है, इमेज-आधारित है, या मिश्रित है, और स्थिति जागरूकता, फ़ॉन्ट जानकारी और मल्टी-कॉलम पठन क्रम के साथ टेक्स्ट निकालता है। लाइब्रेरी PDF को साफ़ Markdown में बदलती है, जिसमें शीर्षक, सूचियाँ, कोड ब्लॉक, टेबल, बोल्ड/इटैलिक फ़ॉर्मेटिंग, URL और पेज ब्रेक शामिल हैं। यह CID फ़ॉन्ट, RTL टेक्स्ट, एन्कोडिंग समस्या का पता लगाने और ज़रूरत वाले पेजों के लिए चयनात्मक OCR रूटिंग का समर्थन करता है। Python, Node.js और ब्राउज़र WebAssembly के लिए बाइंडिंग उपलब्ध हैं, साथ ही CLI टूल (pdf2md और detect-pdf) भी हैं। डिफ़ॉल्ट बिल्ड हल्के रहते हैं, OCR निर्भरताएँ केवल ज़रूरत पड़ने पर लोड होती हैं। opendataloader-bench कॉर्पस पर बेंचमार्क रिपोर्ट, शोध पत्र, चालान और कानूनी दस्तावेज़ों जैसे नेटिव-टेक्स्ट PDF के लिए प्रतिस्पर्धी गति और गुणवत्ता दिखाते हैं।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.