Bob 是一款 macOS 菜单栏翻译与 OCR 工具,支持划词、截图、输入翻译,以及截图 OCR、静默识别、二维码识别等,可接入多家翻译与 OCR 服务并提供离线识别与语音合成。
好开源,值得被发现。
发现优质开源项目,匿名提交开源项目,认领编辑你的开源项目。
带着好奇心,发现开源世界。
THE FIRST COLLECTIONAurexTranslator 是一个跨平台的实时屏幕翻译器,支持 Windows 和 Linux(X11/XWayland)。它可以翻译通过 OCR 捕获的文本、剪贴板中的文本,或者通过可注入的引擎特定插件直接从游戏进程中提取的文本。
VSE 是一款本地运行的视频硬字幕提取工具,通过深度学习检测字幕区域并 OCR 识别文本,生成 SRT/TXT 外挂字幕,支持 87 种语言、批量处理与 GPU 加速,无需调用第三方 API。
PaddleOCR 是由飞桨开发的全能 OCR 和文档 AI 工具包,可将 PDF 和图像转换为 JSON 或 Markdown 格式的结构化数据。核心组件包括:支持 100+ 语言的 PP-OCRv6、0.9B 参数的视觉语言模型 PaddleOCR-VL、细粒度坐标感知的 PP-StructureV3,以及轻量的 HPD-Parsing。支持多硬件平台和 ONNX/OpenVINO/TensorRT 部署,可集成 Dify、RAGFlow 等平台,并提供浏览器端 SDK PaddleOCR.js。
Tesseract 是一款开源 OCR 引擎,提供命令行工具和库,支持 100 多种语言的图像文本识别。
Paperless-ngx 是一款文档管理系统,旨在将纸质文档转换为可搜索的在线存档,从而减少纸张使用。
一个将已获授权的 YouTube 视频本地化为中文字幕并辅助发布至 B 站的 Python 工具,支持语音转写、OCR 识别、LLM 翻译及硬字幕渲染。
Skill Seekers 是一款 CLI 工具,可将文档、GitHub 仓库、PDF、视频等 18 种源类型转化为结构化知识资产,支持 Claude、Gemini、OpenAI 等平台,具备跨源冲突检测与 22 种导出目标。
PageLedger 是一个用于可审计的、页面级 OCR 和文档提取的 Python CLI 库。它记录每个提取页面的来源、质量信号和预算,支持可恢复运行、审查队列以及带人工参与验证的重新运行。
MinerU 是一款开源文档解析引擎,可将 PDF、图片、DOCX、PPTX 和 XLSX 转换为结构化 Markdown/JSON,服务于 LLM、RAG 和 agent 工作流。它支持 VLM+OCR 双引擎、109 种语言 OCR,以及私有化/离线部署。
Tesseract.js 是一款支持 100 余种语言的 JavaScript 光学字符识别(OCR)库,可通过 WebAssembly 在浏览器和 Node.js 环境运行,是对独立 Tesseract OCR 引擎的封装,未修改其核心识别模型,也不支持 PDF 文件处理。
EasyOCR 是一个开箱即用的光学字符识别库,支持 80+ 种语言和主流书写系统,提供简单的 Python API 和命令行工具,基于 PyTorch 的检测与识别模型,并支持自定义训练。
Dolphin是字节跳动开源的文档图像解析模型(ACL 2025),可将PDF和拍摄页面转换为结构化Markdown/JSON,涵盖布局、阅读顺序、文本、表格、公式和代码。
X-AnyLabeling 是一款轻量级、统一的跨平台桌面应用,用于 AI 辅助数据标注,支持文本、图像、视频和多模态数据,内置多种深度学习模型与丰富标注工具,并支持多格式导入导出。
AksharaMD是一个本地运行的解析器无关工具,用于评估文档解析器将源文件转换为AI友好型Markdown的质量,提供每文档就绪评分、块级来源标签、命名警告以及可选的基于源文件的接受/拒绝判定。
Umi-OCR 是一款免费开源的离线 OCR 文字识别工具,支持截图识别、批量图片导入、PDF 文档识别、二维码扫描与生成,内置多国语言识别库,并提供命令行与 HTTP 接口调用。
OCRmyPDF 是一款命令行工具,可为扫描 PDF 添加可搜索的 OCR 文字层,生成验证后的 PDF/A 文件。它使用 Tesseract 识别超过100种语言,支持校正倾斜和旋转页面,可在 Linux、macOS、Windows 和 FreeBSD 上运行。