عن المشروع
PaddleOCR هو مجموعة أدوات شاملة للتعرف الضوئي على الحروف (OCR) والذكاء الاصطناعي في المستندات، طوّرتها PaddlePaddle. تُحوّل وثائق PDF والصور إلى بيانات مهيكلة جاهزة للنماذج اللغوية الكبيرة (LLMs) بصيغ JSON أو Markdown.
المكونات الرئيسية:
- PP-OCRv6: نموذج التعرف على النصوص متعدد اللغات يدعم أكثر من 50 لغة في نموذج موحد واحد، يشمل الصينية والإنجليزية واليابانية و46 لغة من اللغات اللاتينية، بالإضافة إلى الخطوط السيريلية والعربية والفالية والعديد من الخطوط الأخرى بإجمال أكثر من 100 لغة. يتوفر بثلاث فئات حجمية (متناهي الصغر 1.5 مليون، صغير 7.7 مليون، وسط 34.5 مليون معامل) مخصصة لنشره على أجهزة الحافة والهواتف المحمولة والخوادم.
- PaddleOCR-VL: نموذج بصري لغوي (0.9 مليار معامل) لتحليل المستندات. يحقق نتائج قوية في معايير التقييم مثل OmniDocBench ويتعامل مع النصوص والصيغ الرياضية والجداول والرسوم البيانية والمستندات القديمة والأختام والأحرف النادرة. يُخرّج بيانات مهيكلة بصيغ Markdown وJSON مع معلومات الإحداثيات.
- PP-StructureV3: مسار تحويل المستندات الواعي بالتصميم يوفر معلومات إحداثيات دقيقة لخلايا الجداول ومنطقة النصوص وعناصر التخطيط الأخرى.
- HPD-Parsing: نموذج بصري لغوي خفيف الوزن لتحليل المستندات عالي الإنتاجية مع فك التشفير المتوازي الهرمي.
تدعم المجموعة.backends عتدية متعددة بما في ذلك وحدات NVIDIA GPU ووحدات Intel CPU ووحدات Kunlunxin XPU ومسرّعات الذكاء الاصطناعي المتنوعة. يمكن نشرها عبر ONNX أو OpenVINO أو TensorRT، أو تقديمها كواجهة API عبر HTTP. تم دمج PaddleOCR مع منصات تطبيقات الذكاء الاصطناعي مثل Dify وRAGFlow وPathway وCherry Studio.
يتوفر SDK رسمي للاستدلال عبر المتصفح باسم PaddleOCR.js، يسمح بتشغيل نماذج PP-OCR مباشرة في المتصفح. تدعم المشروع أيضاً تحويل مستندات Word وExcel وPowerPoint إلى Markdown، وتصدير النتائج المُحلَّلة إلى صيغة DOCX.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.