इस प्रोजेक्ट के बारे में
MarkItDown एक Python-आधारित टूल है जो दस्तावेज़ संरचनाओं जैसे हेडिंग, सूचियों, तालिकाओं और लिंक को सुरक्षित रखते हुए कई फ़ाइल स्वरूपों को Markdown में परिवर्तित करता है। इसे Large Language Models (LLMs) और टेक्स्ट विश्लेषण टूल द्वारा डेटा की खपत के लिए तैयार करने हेतु डिज़ाइन किया गया है।
समर्थित स्वरूपों में शामिल हैं:
- ऑफिस दस्तावेज़: Word, PowerPoint, Excel (पुराने .xls स्वरूपों सहित)।
- दस्तावेज़ और वेब: PDF, HTML, EPub।
- डेटा स्वरूप: CSV, JSON, XML।
- मल्टीमीडिया: इमेज (EXIF और OCR), ऑडियो (EXIF और ट्रांसक्रिप्शन), और YouTube URLs।
- आर्काइव्स: ZIP फ़ाइलें।
मुख्य विशेषताएं और एकीकरण:
- LLM एकीकरण: इमेज विवरण उत्पन्न करने और प्लगइन्स के माध्यम से OCR करने के लिए LLM क्लाइंट्स (जैसे OpenAI) के उपयोग का समर्थन करता है।
- Azure एकीकरण: उच्च-सटीकता वाले क्लाउड-आधारित निष्कर्षण के लिए Azure Document Intelligence और Azure Content Understanding के साथ वैकल्पिक एकीकरण प्रदान करता है, जिसमें वीडियो और स्ट्रक्चर्ड फ़ील्ड निष्कर्षण (YAML front matter) के लिए मल्टी-मोडल समर्थन शामिल है।
- विस्तारशीलता: नए फ़ाइल स्वरूप कन्वर्टर्स जोड़ने के लिए एक प्लगइन सिस्टम का समर्थन करता है।
- इंटरफ़ेस: बड़े वर्कफ़्लो में एकीकरण के लिए कमांड-लाइन इंटरफ़ेस (CLI) और Python API दोनों प्रदान करता है।