PaddleOCR একটি ওপেন-সোর্স OCR টুলকিট যা PDF এবং ছবি থেকে LLM-এর জন্য গঠিত ডেটা (JSON/Markdown) তৈরি করে। এতে PP-OCRv6, PaddleOCR-VL, এবং PP-StructureV3 অন্তর্ভুক্ত।
ওপেন সোর্স। নতুন সম্ভাবনা।
মানসম্মত ওপেন-সোর্স প্রজেক্ট আবিষ্কার করুন, বেনামে প্রজেক্ট জমা দিন এবং নিজের প্রজেক্ট দাবি করে সম্পাদনা করুন।
কৌতূহল নিয়ে ওপেন সোর্স আবিষ্কার করুন।
THE FIRST COLLECTIONTesseract হলো একটি ওপেন-সোর্স OCR ইঞ্জিন যা ১০০টিরও বেশি ভাষায় ছবির লেখা শনাক্ত করার জন্য একটি কমান্ড-লাইন টুল এবং লাইব্রেরি প্রদান করে।
PageLedger একটি ওপেন-সোর্স পাইথন CLI লাইব্রেরি যা OCR এবং নথি এক্সট্রাকশনের জন্য পৃষ্ঠা-স্তরের অডিটেবল ট্র্যাকিং প্রদান করে। এটি প্রতিটি পৃষ্ঠার জন্য প্রমাণিক, গুণমান সংকেত এবং বাজেট ট্র্যাক করে, রিসামেবল রান এবং মূল্যায়ন কিউ সাপোর্ট করে।
AksharaMD একটি স্থানীয়, পার্সার-নির্ভর নয় এমন টুল যা মূল্যায়ন করে যে একটি নির্বাচিত ডকুমেন্ট পার্সার একটি সোর্স ফাইলকে AI-বান্ধব মার্কডাউনে কতটা ভালোভাবে রূপান্তর করেছে, প্রতি-ডকুমেন্ট প্রস্তুতি স্কোর, ব্লক-স্তরের উৎস ট্যাগ, নামযুক্ত সতর্কতা এবং একটি ঐচ্ছিক উৎস-ভিত্তিক ACCEPT/REJECT রায় ফেরত দেয়।