tesseracttesseract-ocr
新收录Tesseract 是一款开源 OCR 引擎,提供命令行工具和库,支持 100 多种语言的图像文本识别。
发现优质开源项目,匿名提交开源项目,认领编辑你的开源项目。
带着好奇心,发现开源世界。
THE FIRST COLLECTIONTesseract 是一款开源 OCR 引擎,提供命令行工具和库,支持 100 多种语言的图像文本识别。
PageLedger 是一个用于可审计的、页面级 OCR 和文档提取的 Python CLI 库。它记录每个提取页面的来源、质量信号和预算,支持可恢复运行、审查队列以及带人工参与验证的重新运行。
Tesseract.js 是一款支持 100 余种语言的 JavaScript 光学字符识别(OCR)库,可通过 WebAssembly 在浏览器和 Node.js 环境运行,是对独立 Tesseract OCR 引擎的封装,未修改其核心识别模型,也不支持 PDF 文件处理。
OCRmyPDF 是一款命令行工具,可为扫描 PDF 添加可搜索的 OCR 文字层,生成验证后的 PDF/A 文件。它使用 Tesseract 识别超过100种语言,支持校正倾斜和旋转页面,可在 Linux、macOS、Windows 和 FreeBSD 上运行。