عن المشروع

pdf-inspector هي مكتبة Rust بُنيت بواسطة Firecrawl لتصنيف ملفات PDF واستخراج النصوص بسرعة. تكتشف ما إذا كان ملف PDF نصياً أو ممسوحاً ضوئياً أو قائماً على الصور أو مختلطاً، وتستخرج النص مع الوعي بالمواضع ومعلومات الخط وترتيب القراءة متعدد الأعمدة. تحول المكتبة ملفات PDF إلى Markdown نظيف، بما في ذلك العناوين والقوائم وكتل التعليمات البرمجية والجداول وتنسيق الخط العريض/المائل وعناوين URL وفواصل الصفحات. تدعم خطوط CID والنص من اليمين إلى اليسار واكتشاف مشكلات الترميز وتوجيه OCR الانتقائي للصفحات التي تحتاج إليه. تتوفر روابط لـ Python وNode.js وWebAssembly للمتصفح، إلى جانب أدوات CLI (pdf2md وdetect-pdf). تبقى البنيات الافتراضية خفيفة الوزن، حيث تُحمَّل اعتماديات OCR فقط عند الحاجة. تُظهر الاختبارات المعيارية على مجموعة opendataloader-bench سرعة وجودة تنافسيتين لملفات PDF ذات النص الأصلي مثل التقارير والأوراق البحثية والفواتير والمستندات القانونية.