इस प्रोजेक्ट के बारे में

pdf-inspector एक Rust लाइब्रेरी है जिसे Firecrawl ने तेज़ PDF वर्गीकरण और टेक्स्ट निष्कर्षण के लिए बनाया है। यह पता लगाता है कि PDF टेक्स्ट-आधारित है, स्कैन किया गया है, इमेज-आधारित है, या मिश्रित है, और स्थिति जागरूकता, फ़ॉन्ट जानकारी और मल्टी-कॉलम पठन क्रम के साथ टेक्स्ट निकालता है। लाइब्रेरी PDF को साफ़ Markdown में बदलती है, जिसमें शीर्षक, सूचियाँ, कोड ब्लॉक, टेबल, बोल्ड/इटैलिक फ़ॉर्मेटिंग, URL और पेज ब्रेक शामिल हैं। यह CID फ़ॉन्ट, RTL टेक्स्ट, एन्कोडिंग समस्या का पता लगाने और ज़रूरत वाले पेजों के लिए चयनात्मक OCR रूटिंग का समर्थन करता है। Python, Node.js और ब्राउज़र WebAssembly के लिए बाइंडिंग उपलब्ध हैं, साथ ही CLI टूल (pdf2md और detect-pdf) भी हैं। डिफ़ॉल्ट बिल्ड हल्के रहते हैं, OCR निर्भरताएँ केवल ज़रूरत पड़ने पर लोड होती हैं। opendataloader-bench कॉर्पस पर बेंचमार्क रिपोर्ट, शोध पत्र, चालान और कानूनी दस्तावेज़ों जैसे नेटिव-टेक्स्ट PDF के लिए प्रतिस्पर्धी गति और गुणवत्ता दिखाते हैं।