这个项目能做什么
MinerU 是一款高精度文档解析引擎,旨在将复杂文档格式转换为机器可读的结构化数据,供下游 LLM、RAG 和 agent 工作流使用。它原生支持 PDF、图片、DOCX、PPTX 和 XLSX 输入,并输出保留阅读顺序的 Markdown 或 JSON。
## 核心能力
- **多格式原生解析**:无需先转换为 PDF,即可处理 PDF、扫描文档、图片、DOCX、PPTX 和 XLSX。
- **结构保留**:移除页眉、页脚、脚注和页码;按人类可读的阅读顺序输出标题、段落、列表、表格和文本,适用于单栏、多栏和复杂版式。
- **公式与表格提取**:自动将公式转换为 LaTeX,将表格转换为 HTML,包括跨页表格合并和表格内容识别。
- **OCR 引擎**:自动检测扫描版或乱码 PDF 并启用 OCR,支持 109 种语言。自 3.4 版本起,pipeline 后端使用 PP-OCRv6。
- **双推理后端**:提供三种模式——`pipeline`(基于规则、快速、支持 CPU/GPU)、`vlm-engine`(基于 VLM、高精度、支持 vLLM/LMDeploy/mlx)和 `hybrid-engine`(结合原生文本提取与 VLM,低幻觉)。
- **模型选择**:VLM 模型包括 MinerU2.5-Pro 系列;3.3 版本引入了 `effort` 参数(medium/high),用于平衡速度与精度。
## 集成与部署
- **SDK 与接口**:Python/Go/TypeScript SDK、CLI、REST API、Docker 和 Gradio WebUI。
- **框架**:与 LangChain、LlamaIndex、RAGFlow、Dify、FastGPT、Flowise 原生集成,并提供 MCP Server,供 Cursor、Claude Desktop 和 Windsurf 等 AI 编码工具使用。
- **路由与扩展**:包含用于同步和异步任务端点的 `mineru-api`,以及用于跨多个服务和 GPU 提供统一入口和负载均衡的 `mineru-router`。支持多线程并发推理。
- **平台支持**:可在 Windows、Linux 和 macOS 上运行,包括纯 CPU 环境以及 GPU/MPS 加速。
- **私有化/离线部署**:模型可下载并缓存到本地;支持昇腾、寒武纪、燧原、沐曦、摩尔线程、昆仑芯、天数智芯、海光、壁仞和平头哥等国产 AI 芯片。
## 许可证与起源
MinerU 源自 InternLM 预训练项目,由 OpenDataLab 维护。从 3.1.0 版本开始,它使用基于 Apache 2.0 的自定义开源许可证(此前为 AGPLv3)。mineru.net 上提供在线 Web 应用、桌面客户端和 API,并在 Hugging Face 和 ModelScope 上提供演示。
评论
0 评分人数达到10人后显示
登录后参与讨论。