منصوبے کے بارے میں
MarkItDown ایک Python پر مبنی ٹول ہے جو دستاویزات کے ڈھانچے جیسے کہ ہیڈنگز، لسٹس، ٹیبلز اور لنکس کو برقرار رکھتے ہوئے متعدد فائل فارمیٹس کو Markdown میں تبدیل کرتا ہے۔ اسے Large Language Models (LLMs) اور ٹیکسٹ اینالیسس ٹولز کے لیے ڈیٹا تیار کرنے کے لیے ڈیزائن کیا گیا ہے۔
سپورٹڈ فارمیٹس میں شامل ہیں:
- آفس دستاویزات: Word, PowerPoint, Excel (بشمول پرانے .xls فارمیٹس)۔
- دستاویزات اور ویب: PDF, HTML, EPub۔
- ڈیٹا فارمیٹس: CSV, JSON, XML۔
- ملٹی میڈیا: تصاویر (EXIF اور OCR)، آڈیو (EXIF اور ٹرانسکرپشن)، اور YouTube URLs۔
- آرکائیوز: ZIP فائلیں۔
اہم خصوصیات اور انٹیگریشنز:
- LLM انٹیگریشن: پلگ انز کے ذریعے تصاویر کی تفصیلات تیار کرنے اور OCR کرنے کے لیے LLM کلائنٹس (مثلاً OpenAI) کے استعمال کی سپورٹ کرتا ہے۔
- Azure انٹیگریشن: ہائی فیلٹی کلاؤڈ بیسڈ ایکسٹریکشن کے لیے Azure Document Intelligence اور Azure Content Understanding کے ساتھ اختیاری انٹیگریشن فراہم کرتا ہے، جس میں ویڈیو اور سٹرکچرڈ فیلڈ ایکسٹریکشن (YAML front matter) کے لیے ملٹی موڈل سپورٹ شامل ہے۔
- توسیع پذیری (Extensibility): نئے فائل فارمیٹ کنورٹرز شامل کرنے کے لیے ایک پلگ ان سسٹم کی سپورٹ کرتا ہے۔
- انٹرفیس: بڑے ورک فلو میں انٹیگریشن کے لیے کمانڈ لائن انٹرفیس (CLI) اور Python API دونوں فراہم کرتا ہے۔