इस प्रोजेक्ट के बारे में

PDF Craft एक Python लाइब्रेरी है जो स्कैन की गई पुस्तकों और अकादमिक या तकनीकी दस्तावेज़ों के लिए बनाई गई है। यह पृष्ठ सामग्री निकालती है और मुख्य पाठ, अध्याय, विषय-सूची, फुटनोट, तालिकाएँ, सूत्र और छवियों को व्यवस्थित करती है ताकि परिणाम को संपादित और पढ़ना आसान हो। मुख्य क्षमताएँ - PDF से Markdown, पाठ और छवि एसेट फ़ाइलों के साथ। - PDF से EPUB, जिसमें पुस्तक मेटाडेटा और विषय-सूची शामिल है। - रूपांतरण के दौरान अनुवाद, या मौजूदा EPUB का अनुवाद, केवल-अनुवाद और द्विभाषी आउटपुट मोड के साथ। - अनूदित PDF आउटपुट: निकाले गए पाठ का अनुवाद किया जाता है और स्रोत पृष्ठों पर वापस लिखा जाता है। - पुनः प्रयोग योग्य निष्कर्षण फ़ाइलें (`.pcex`) जिन्हें एक बार सहेजा जा सकता है और बाद में रेंडरिंग, अनुवाद या किसी अन्य मशीन पर प्रसंस्करण के लिए पुनः उपयोग किया जा सकता है। उपयोग के तरीके - ब्राउज़र में वर्कफ़्लो आज़माने के लिए ऑनलाइन ऐप। - रिमोट OCR के साथ Python, उन डेवलपर्स के लिए जो OCR मॉडल स्थानीय रूप से नहीं चलाना चाहते; इसके लिए Python, Poppler, और एक संगत OCR सेवा URL और क्रेडेंशियल आवश्यक हैं। - स्थानीय OCR के साथ Python, उन डेवलपर्स के लिए जिनके पास अपना NVIDIA GPU है; इसके लिए Python, Poppler, CUDA, पर्याप्त VRAM और मॉडल फ़ाइलें आवश्यक हैं। त्वरित शुरुआत `python -m pip install pdf-craft` से इंस्टॉल करें, फिर एक OCR विक्रेता (उदाहरण के लिए DeepSeek OCR-संगत सेवा) कॉन्फ़िगर करें और `convert_pdf_to_markdown` या `convert_pdf_to_epub` को कॉल करें। असिंक्रोनस अनुप्रयोगों के लिए एक `AsyncPDFCraft` फ़साड उपलब्ध है; सिंक्रोनस फ़साड को चल रहे इवेंट लूप से कॉल नहीं किया जाना चाहिए। README में उल्लेख है कि उदाहरण एंडपॉइंट प्लेसहोल्डर हैं और उन्हें एक कार्यशील सेवा से बदला जाना चाहिए। OCR और आवश्यकताएँ यह प्रोजेक्ट DeepSeek OCR, DeepSeek OCR 2 और Unlimited OCR का समर्थन करता है, प्रत्येक में स्थानीय और रिमोट कॉन्फ़िगरेशन के साथ। मानक इंस्टॉलेशन रिमोट OCR का समर्थन करता है; स्थानीय OCR के लिए `pdf-craft[local]` एक्स्ट्रा, एक संगत CUDA-सक्षम PyTorch बिल्ड, पर्याप्त VRAM और मॉडल फ़ाइलें आवश्यक हैं, जो डिफ़ॉल्ट रूप से Hugging Face से डाउनलोड होती हैं या स्थानीय रूप से लोड की जा सकती हैं। भाषा समर्थन प्रसंस्करण चरण पर निर्भर करता है: पाठ पहचान OCR मॉडल पर निर्भर करती है, और अनुवाद अनुवादक और पाठ LLM पर निर्भर करता है। EPUB का `lan` पैरामीटर वर्तमान में `zh` और `en` प्रदान करता है। दस्तावेज़ीकरण और प्रतिक्रिया README में इंस्टॉलेशन, OCR बैकएंड, PDF रूपांतरण और अनुवाद, EPUB अनुवाद, API संदर्भ, `.pcex` प्रारूप और समस्या निवारण के लिए गाइड के लिंक हैं। इश्यू और पुल रिक्वेस्ट का स्वागत है; रूपांतरण समस्याओं के लिए प्रोजेक्ट पैकेज संस्करण, OCR कॉन्फ़िगरेशन प्रकार, त्रुटि लॉग और एक साझा करने योग्य न्यूनतम फ़ाइल मांगता है, जिसमें पहले क्रेडेंशियल और निजी सामग्री हटा दी गई हो। यह प्रोजेक्ट MIT लाइसेंस के तहत जारी किया गया है, और तृतीय-पक्ष निर्भरताएँ और चयनित OCR मॉडल अपने स्वयं के लाइसेंस बनाए रखते हैं।