VSE হলো একটি লোকালি চালিত ভিডিও হার্ড-সাবটাইটেল এক্সট্রাকশন টুল, যা ডিপ লার্নিং দিয়ে সাবটাইটেল অঞ্চল শনাক্ত করে এবং OCR দিয়ে টেক্সট চেনে, SRT/TXT এক্সটার্নাল সাবটাইটেল তৈরি করে, ৮৭টি ভাষা, ব্যাচ প্রসেসিং ও GPU এক্সিলারেশন সমর্থন করে, কোনো তৃতীয় পক্ষের API ছাড়াই।
ওপেন সোর্স। নতুন সম্ভাবনা।
মানসম্মত ওপেন-সোর্স প্রজেক্ট আবিষ্কার করুন, বেনামে প্রজেক্ট জমা দিন এবং নিজের প্রজেক্ট দাবি করে সম্পাদনা করুন।
কৌতূহল নিয়ে ওপেন সোর্স আবিষ্কার করুন।
THE FIRST COLLECTIONPaddleOCR একটি ওপেন-সোর্স OCR টুলকিট যা PDF এবং ছবি থেকে LLM-এর জন্য গঠিত ডেটা (JSON/Markdown) তৈরি করে। এতে PP-OCRv6, PaddleOCR-VL, এবং PP-StructureV3 অন্তর্ভুক্ত।
Tesseract হলো একটি ওপেন-সোর্স OCR ইঞ্জিন যা ১০০টিরও বেশি ভাষায় ছবির লেখা শনাক্ত করার জন্য একটি কমান্ড-লাইন টুল এবং লাইব্রেরি প্রদান করে।
Paperless-ngx হলো একটি ডকুমেন্ট ম্যানেজমেন্ট সিস্টেম যা কাগজের ব্যবহার কমাতে ফিজিক্যাল ডকুমেন্টগুলোকে একটি অনুসন্ধানযোগ্য অনলাইন আর্কাইভে রূপান্তর করে।
এটি একটি Python টুল যা অনুমোদিত YouTube ভিডিওকে বাংলা উপশিরসের সাথে স্থানীয়করণ করে এবং B সাইটে প্রকাশে সহায়তা করে, যা শব্দ নথিভুক্তি, OCR শনাক্ত, LLM অনুবাদ এবং হার্ড সাবটাইটেল রেন্ডারিং সমর্থন করে।
Skill Seekers হলো একটি CLI টুল যা ডকুমেন্টেশন, GitHub রিপো, PDF, ভিডিওসহ ১৮টি সোর্স টাইপকে AI Skills-এ রূপান্তর করে—Claude, Gemini, OpenAI-র জন্য কনফ্লিক্ট ডিটেকশন ও ২২টি এক্সপোর্ট টার্গেট সমর্থন করে।
PageLedger একটি ওপেন-সোর্স পাইথন CLI লাইব্রেরি যা OCR এবং নথি এক্সট্রাকশনের জন্য পৃষ্ঠা-স্তরের অডিটেবল ট্র্যাকিং প্রদান করে। এটি প্রতিটি পৃষ্ঠার জন্য প্রমাণিক, গুণমান সংকেত এবং বাজেট ট্র্যাক করে, রিসামেবল রান এবং মূল্যায়ন কিউ সাপোর্ট করে।
MinerU একটি ওপেন-সোর্স ডকুমেন্ট পার্সিং ইঞ্জিন যা PDF, ছবি, DOCX, PPTX এবং XLSX-কে LLM, RAG ও এজেন্ট ওয়ার্কফ্লোর জন্য স্ট্রাকচার্ড Markdown/JSON-এ রূপান্তর করে। এটি VLM+OCR ডুয়াল ইঞ্জিন, ১০৯ ভাষার OCR এবং প্রাইভেট/অফলাইন ডিপ্লয়মেন্ট সমর্থন করে।
Tesseract.js একটি জাভাস্ক্রিপ্ট OCR লাইব্রেরি যা ১০০ এরও বেশি ভাষায় ছবি থেকে টেক্সট বের করে। এটি WebAssembly এর মাধ্যমে ব্রাউজারে এবং Node.js-এ চলে।
EasyOCR একটি প্রস্তুত-ব্যবহারযোগ্য অপটিক্যাল ক্যারেক্টার রিকগনিশন লাইব্রেরি যা ৮০+ ভাষা এবং প্রধান লেখার স্ক্রিপ্ট সমর্থন করে। এটি সহজ Python API এবং CLI অফার করে, PyTorch-ভিত্তিক ডিটেকশন এবং রিকগনিশন মডেল সহ, এবং কাস্টম প্রশিক্ষণের বিকল্পও রয়েছে।
ByteDance-এর খোলা-উৎস ডকুমেন্ট ইমেজ পার্সিং মডেল (ACL 2025) যা PDF এবং ছবি তোলা পাতাকে কাঠামোবদ্ধ Markdown/JSON-এ রূপান্তর করে, লেআউট, পঠন ক্রম, টেক্সট, টেবিল, সূত্র এবং কোড সহ।
X-AnyLabeling একটি ক্রস-প্ল্যাটফর্ম ডেস্কটপ অ্যাপ্লিকেশন, যা টেক্সট, ইমেজ, ভিডিও ও মাল্টিমোডাল ডেটার এআই-সহায়ক অ্যানোটেশনের জন্য ব্যবহৃত হয়। এতে রয়েছে বহু লেবেলিং টুল, বিল্ট-ইন ডিপ লার্নিং মডেল এবং বিভিন্ন ফরম্যাটে ইমপোর্ট/এক্সপোর্ট সুবিধা।
AksharaMD একটি স্থানীয়, পার্সার-নির্ভর নয় এমন টুল যা মূল্যায়ন করে যে একটি নির্বাচিত ডকুমেন্ট পার্সার একটি সোর্স ফাইলকে AI-বান্ধব মার্কডাউনে কতটা ভালোভাবে রূপান্তর করেছে, প্রতি-ডকুমেন্ট প্রস্তুতি স্কোর, ব্লক-স্তরের উৎস ট্যাগ, নামযুক্ত সতর্কতা এবং একটি ঐচ্ছিক উৎস-ভিত্তিক ACCEPT/REJECT রায় ফেরত দেয়।
Umi-OCR একটি বিনামূল্যের ও ওপেন-সোর্স অফলাইন OCR টেক্সট শনাক্তকরণ টুল, যা স্ক্রিনশট শনাক্তকরণ, ব্যাচ ইমেজ আমদানি, PDF ডকুমেন্ট শনাক্তকরণ, QR কোড স্ক্যান ও তৈরি সমর্থন করে, এবং একাধিক ভাষার শনাক্তকরণ লাইব্রেরি অন্তর্ভুক্ত, পাশাপাশি কমান্ড লাইন ও HTTP ইন্টারফেস কল প্রদান করে।
OCRmyPDF একটি কমান্ড-লাইন টুল যা স্ক্যান করা PDF ফাইলে অনুসন্ধানযোগ্য OCR টেক্সট স্তর যোগ করে, যা যাচাইকৃত PDF/A আউটপুট তৈরি করে। এটি ১০০-এর বেশি ভাষায় Tesseract ব্যবহার করে, ডেস্কিউয়িং এবং রোটেশন সংশোধন সমর্থন করে, এবং Linux, macOS, Windows ও FreeBSD-এ চলে।
Bob একটি macOS মেনুবার-ভিত্তিক অনুবাদ ও OCR টুল, যা নির্বাচিত পাঠ্য, স্ক্রিনশট, ইনপুট অনুবাদ এবং স্ক্রিনশট OCR, নীরব স্বীকৃতি, QR কোড স্বীকৃতি সমর্থন করে; একাধিক অনুবাদ ও OCR পরিষেবা সংযুক্ত করে এবং অফলাইন স্বীকৃতি ও টেক্সট-টু-স্পিচ প্রদান করে।
AurexTranslator হল একটি ক্রস-প্ল্যাটফর্ম, রিয়েল-টাইম স্ক্রিন অনুবাদক Windows এবং Linux (X11/XWayland) এর জন্য। এটি OCR দ্বারা ক্যাপচার করা, ক্লিপবোর্ড থেকে, অথবা ইনজেক্টেবল ইঞ্জিন-স্পেসিফিক প্লাগইনগুলির মাধ্যমে সরাসরি একটি গেম প্রসেস থেকে হুক করা টেক্সট অনুবাদ করে।