عن المشروع
dots.ocr هو نموذج لغوي بصري مفتوح المصدر يركز على تحليل تخطيط المستندات. وفقًا لملف README الخاص به، تم تصميمه ليكون متاحًا عالميًا ويمكنه التعرف على مجموعة واسعة من النصوص البشرية. ويُظهر نتائج قوية في معايير تحليل المستندات متعددة اللغات بين النماذج ذات الحجم المماثل، كما يتعامل مع الرسومات المنظمة مثل المخططات والرسوم البيانية عن طريق تحويلها إلى كود SVG، بالإضافة إلى لقطات الويب والنصوص في المشاهد.
القدرات الرئيسية الموصوفة في ملف README:
- تحليل المستندات متعدد اللغات: يستخرج عناصر التخطيط مع مربعات الإحاطة والفئات والمحتوى النصي من الصور وملفات PDF.
- تشمل فئات التخطيط: التسمية التوضيحية، الحاشية السفلية، الصيغة، عنصر القائمة، تذييل الصفحة، رأس الصفحة، الصورة، رأس القسم، الجدول، النص، والعنوان.
- تنسيق الإخراج: الصيغ بصيغة LaTeX، والجداول بصيغة HTML، والنصوص الأخرى بصيغة Markdown، مع ترتيب العناصر بترتيب القراءة البشري.
- تحليل الرسومات المنظمة: يحول المخططات والرسوم البيانية والصيغ الكيميائية والشعارات إلى كود SVG.
- مهام إضافية: تحليل صفحات الويب واكتشاف النصوص في المشاهد.
- كما يدعم الإجابة على الأسئلة البصرية العامة.
النشر والاستخدام:
- التثبيت عبر conda وpip، مع توفير صورة Docker كبديل.
- يمكن تنزيل أوزان النموذج باستخدام سكريبت مقدم، بما في ذلك خيار ModelScope.
- يُوصى باستخدام vLLM للنشر؛ يذكر ملف README أن dots.ocr تم دمجه في vLLM منذ الإصدار 0.11.0.
- يتم دعم الاستدلال عبر Hugging Face Transformers، بما في ذلك مسار استدلال CPU مشار إليه في مشكلة.
- يمكن لسكريبت المحلل معالجة صورة واحدة أو ملف PDF، مع خيارات لاكتشاف التخطيط فقط أو تحليل النص فقط، ويمكنه إخراج JSON منظم وMarkdown وصورة تصور التخطيط.
- تتوفر نسخة تجريبية مباشرة.
يسرد ملف README أيضًا القيود: تظل الجداول المعقدة والصيغ الرياضية صعبة نظرًا لبنية النموذج المدمجة، وتحليل الرسومات المنظمة القائم على SVG ليس قويًا تمامًا بعد، وقد تحدث أخطاء تحليل عرضية. ويشير إلى أن dots.ocr-1.5 تمت إعادة تسميته لاحقًا إلى dots.mocr، مع أوزان محدثة وورقة بحثية.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.