OPEN SOURCE, OPEN TO EVERYONE

好开源,值得被发现。

发现优质开源项目,匿名提交开源项目,认领编辑你的开源项目。

人工精选 · 发现好开源4083已发现

带着好奇心,发现开源世界。

THE FIRST COLLECTION
Topic: ocr清除
bobripperhe
新收录

Bob 是一款 macOS 菜单栏翻译与 OCR 工具,支持划词、截图、输入翻译,以及截图 OCR、静默识别、二维码识别等,可接入多家翻译与 OCR 服务并提供离线识别与语音合成。

效率办公人工智能实用工具
新收录

AurexTranslator 是一个跨平台的实时屏幕翻译器,支持 Windows 和 Linux(X11/XWayland)。它可以翻译通过 OCR 捕获的文本、剪贴板中的文本,或者通过可注入的引擎特定插件直接从游戏进程中提取的文本。

效率办公游戏相关实用工具
新收录

VSE 是一款本地运行的视频硬字幕提取工具,通过深度学习检测字幕区域并 OCR 识别文本,生成 SRT/TXT 外挂字幕,支持 87 种语言、批量处理与 GPU 加速,无需调用第三方 API。

视频与影视人工智能字幕与动画
paddleocrPaddlePaddle
新收录

PaddleOCR 是由飞桨开发的全能 OCR 和文档 AI 工具包,可将 PDF 和图像转换为 JSON 或 Markdown 格式的结构化数据。核心组件包括:支持 100+ 语言的 PP-OCRv6、0.9B 参数的视觉语言模型 PaddleOCR-VL、细粒度坐标感知的 PP-StructureV3,以及轻量的 HPD-Parsing。支持多硬件平台和 ONNX/OpenVINO/TensorRT 部署,可集成 Dify、RAGFlow 等平台,并提供浏览器端 SDK PaddleOCR.js。

人工智能开发工具图像 / 音视频 AI
tesseracttesseract-ocr
新收录

Tesseract 是一款开源 OCR 引擎,提供命令行工具和库,支持 100 多种语言的图像文本识别。

人工智能开发工具图像 / 音视频 AI
paperless-ngxpaperless-ngx
新收录

Paperless-ngx 是一款文档管理系统,旨在将纸质文档转换为可搜索的在线存档,从而减少纸张使用。

游戏相关游戏服务器
新收录

一个将已获授权的 YouTube 视频本地化为中文字幕并辅助发布至 B 站的 Python 工具,支持语音转写、OCR 识别、LLM 翻译及硬字幕渲染。

音乐相关音频编辑
skill_seekersyusufkaraaslan
新收录

Skill Seekers 是一款 CLI 工具,可将文档、GitHub 仓库、PDF、视频等 18 种源类型转化为结构化知识资产,支持 Claude、Gemini、OpenAI 等平台,具备跨源冲突检测与 22 种导出目标。

音乐相关DAW 与制作
pageledgerpeterbussch
新收录

PageLedger 是一个用于可审计的、页面级 OCR 和文档提取的 Python CLI 库。它记录每个提取页面的来源、质量信号和预算,支持可恢复运行、审查队列以及带人工参与验证的重新运行。

开发工具人工智能命令行与终端
mineruopendatalab
新收录

MinerU 是一款开源文档解析引擎,可将 PDF、图片、DOCX、PPTX 和 XLSX 转换为结构化 Markdown/JSON,服务于 LLM、RAG 和 agent 工作流。它支持 VLM+OCR 双引擎、109 种语言 OCR,以及私有化/离线部署。

人工智能开发工具RAG / 知识库
新收录

Tesseract.js 是一款支持 100 余种语言的 JavaScript 光学字符识别(OCR)库,可通过 WebAssembly 在浏览器和 Node.js 环境运行,是对独立 Tesseract OCR 引擎的封装,未修改其核心识别模型,也不支持 PDF 文件处理。

开发工具人工智能组件库
easyocrJaidedAI
新收录

EasyOCR 是一个开箱即用的光学字符识别库,支持 80+ 种语言和主流书写系统,提供简单的 Python API 和命令行工具,基于 PyTorch 的检测与识别模型,并支持自定义训练。

人工智能开发工具图像 / 音视频 AI
dolphinbytedance
新收录

Dolphin是字节跳动开源的文档图像解析模型(ACL 2025),可将PDF和拍摄页面转换为结构化Markdown/JSON,涵盖布局、阅读顺序、文本、表格、公式和代码。

人工智能效率办公图像 / 音视频 AI
新收录

X-AnyLabeling 是一款轻量级、统一的跨平台桌面应用,用于 AI 辅助数据标注,支持文本、图像、视频和多模态数据,内置多种深度学习模型与丰富标注工具,并支持多格式导入导出。

人工智能开发工具训练 / 微调 / 评测
aksharamdK2alyan
新收录

AksharaMD是一个本地运行的解析器无关工具,用于评估文档解析器将源文件转换为AI友好型Markdown的质量,提供每文档就绪评分、块级来源标签、命名警告以及可选的基于源文件的接受/拒绝判定。

人工智能开发工具RAG / 知识库
umi-ocrhiroi-sora
新收录

Umi-OCR 是一款免费开源的离线 OCR 文字识别工具,支持截图识别、批量图片导入、PDF 文档识别、二维码扫描与生成,内置多国语言识别库,并提供命令行与 HTTP 接口调用。

效率办公人工智能实用工具
ocrmypdfocrmypdf
新收录

OCRmyPDF 是一款命令行工具,可为扫描 PDF 添加可搜索的 OCR 文字层,生成验证后的 PDF/A 文件。它使用 Tesseract 识别超过100种语言,支持校正倾斜和旋转页面,可在 Linux、macOS、Windows 和 FreeBSD 上运行。

效率办公自动化实用工具