عن المشروع

تُعد Docling مكتبة لمعالجة المستندات من أبحاث IBM، مصممة خصيصًا لإعداد المستندات لتطبيقات الذكاء الاصطناعي التوليدي. تدعم المكتبة تحليل مجموعة واسعة من التنسيقات، بما في ذلك PDF، وDOCX، وPPTX، وXLSX، وHTML، وEPUB، وODF، وملفات Apple Pages، وLaTeX، والنصوص العادية، بالإضافة إلى الصور (PNG، TIFF، JPEG)، والصوت (WAV، MP3)، والفيديو (MP4، AVI، MOV، MKV، WebM)، ورسائل البريد الإلكتروني (EML، MSG)، وتقارير XBRL المالية، وغيرها الكثير. بالنسبة لملفات PDF، تقدم Docling فهماً متقدماً لهيكل الصفحة، وترتيب القراءة، وهياكل الجداول، والكود، والصيغ الرياضية، وتصنيف الصور. يتم تمثيل المستندات بتنسيق موحد يُعرف بـ DoclingDocument، ويمكن تصديرها إلى Markdown، وHTML، وJSON، وWebVTT، وDocLang، وDocTags. تدعم المكتبة التنفيذ المحلي البيئات المعزولة (air-gapped)، وتوفر إمكانيات شاملة للتعرف الضوئي على الحروف (OCR) للملفات الممسوحة ضوئياً، كما تدعم النماذج اللغوية البصرية اختيارية مثل GraniteDocling. تستخدم المكتبة نماذج التعرف على الكلام (ASR) لنسخ الصوتيات، بينما ينتج تحليل الفيديو نصوصاً وإطارات رئيسية. يتضمن المشروع واجهة سطر أوامر بسيطة (CLI)، وخادم API، وخادم MCP، بالإضافة إلى تكاملات أصلية مع LangChain وLlamaIndex وCrew AI وHaystack. تُرخص المكتبة بموجب رخصة MIT وتستضيف تحت مظلة LF AI & Data. يمكن تثبيتها عبر pip (يتطلب Python 3.10+)، ويوضح ملف README كيفية تحويل عنوان URL لملف PDF إلى Markdown باستخدام بضعة أسطر من كود Python.