tesseracttesseract-ocr
신규Tesseract는 100개 이상의 언어에서 이미지 내 텍스트를 인식할 수 있는 명령줄 도구와 라이브러리를 제공하는 오픈 소스 OCR 엔진입니다.
우수한 오픈 소스 프로젝트를 발견하고, 익명으로 프로젝트를 제출하며, 내 프로젝트를 신청해 편집하세요.
호기심으로 오픈 소스의 세계를 발견하세요.
THE FIRST COLLECTIONTesseract는 100개 이상의 언어에서 이미지 내 텍스트를 인식할 수 있는 명령줄 도구와 라이브러리를 제공하는 오픈 소스 OCR 엔진입니다.
PageLedger는 감사 가능한 페이지 단위 OCR 및 문서 추출을 위한 Python CLI 라이브러리입니다. 각 추출된 페이지마다 provenance, 품질 신호, 비용을 기록하며 재개 가능한 실행, 검토 대기열, 인간 참여 검증이 가능합니다.
Tesseract.js is a JavaScript OCR library that extracts text from images in over 100 languages. It runs in browsers via WebAssembly and on Node.js, wrapping the Tesseract engine without modifying its recognition model.
OCRmyPDF는 스캔된 PDF에 검색 가능한 OCR 텍스트 레이어를 추가하여 검증된 PDF/A 출력을 생성하는 명령줄 도구입니다. Tesseract를 사용해 100개 이상의 언어를 지원하며, 기울기 보정 및 회전 보정 기능을 제공합니다.