Tesseract — это OCR-движок с открытым исходным кодом, предоставляющий инструмент командной строки и библиотеку для распознавания текста на изображениях более чем на 100 языках.
Открытый код. Новые возможности.
Находите качественные проекты с открытым исходным кодом, отправляйте проекты анонимно, заявляйте права на свои проекты и редактируйте их.
Немного любопытства. Мир открытого кода.
THE FIRST COLLECTIONPageLedger — это библиотека Python с CLI для аудируемого постраничного OCR и извлечения документов. Она фиксирует происхождение, сигналы качества и бюджеты для каждой извлечённой страницы, поддерживает возобновляемые запуски, очереди проверки и перезапуски с участием человека.
Tesseract.js — JavaScript-библиотека для оптического распознавания символов (OCR), извлекающая текст из изображений более чем на 100 языках. Работает в браузере через WebAssembly и в Node.js, обёртывая движок Tesseract без изменения модели распознавания.
OCRmyPDF — это инструмент командной строки, который добавляет поисковый OCR-слой в сканированные PDF-файлы, создавая валидный PDF/A. Использует Tesseract для распознавания более чем на 100 языках, поддерживает исправление наклона и поворота страниц, работает на Linux, macOS, Windows и FreeBSD.