প্রকল্প সম্পর্কে

pdf-inspector হল ফায়ারক্রল দ্বারা নির্মিত একটি রাস্ট লাইব্রেরি যা দ্রুত পিডিএফ শ্রেণীবিভাগ এবং টেক্সট নিষ্কাশনের জন্য। এটি সনাক্ত করে যে একটি পিডিএফ টেক্সট-ভিত্তিক, স্ক্যান করা, ইমেজ-ভিত্তিক নাকি মিশ্র, এবং অবস্থান সচেতনতা, ফন্ট তথ্য এবং মাল্টি-কলাম পড়ার ক্রম সহ টেক্সট নিষ্কাশন করে। লাইব্রেরিটি পিডিএফকে পরিষ্কার মার্কডাউনে রূপান্তর করে, যার মধ্যে রয়েছে শিরোনাম, তালিকা, কোড ব্লক, টেবিল, বোল্ড/ইটালিক ফরম্যাটিং, ইউআরএল এবং পৃষ্ঠা বিরতি। এটি সিআইডি ফন্ট, আরটিএল টেক্সট, এনকোডিং সমস্যা সনাক্তকরণ এবং যে পৃষ্ঠাগুলির প্রয়োজন তাদের জন্য নির্বাচনী ওসিআর রাউটিং সমর্থন করে। পাইথন, নোড.জেএস এবং ব্রাউজার ওয়েবঅ্যাসেম্বলির জন্য বাইন্ডিং উপলব্ধ, পাশাপাশি সিএলআই টুলস (pdf2md এবং detect-pdf) রয়েছে। ডিফল্ট বিল্ডগুলি হালকা থাকে, যেখানে ওসিআর নির্ভরতা শুধুমাত্র প্রয়োজন হলেই লোড হয়। opendataloader-bench কর্পাসের বেঞ্চমার্কগুলি নেটিভ-টেক্সট পিডিএফ যেমন রিপোর্ট, গবেষণাপত্র, চালান এবং আইনি নথির জন্য প্রতিযোগিতামূলক গতি এবং গুণমান দেখায়।