Sobre o projeto
MinerU é um motor de análise de documentos de alta precisão projetado para converter formatos de documentos complexos em dados estruturados legíveis por máquina para fluxos de trabalho downstream de LLM, RAG e agentes. Ele suporta nativamente entradas PDF, imagens, DOCX, PPTX e XLSX, e produz Markdown ou JSON com preservação da ordem de leitura.
## Principais Capacidades
- **Análise nativa multiformato**: Lida com PDF, documentos digitalizados, imagens, DOCX, PPTX e XLSX sem exigir conversão prévia para PDF.
- **Preservação de estrutura**: Remove cabeçalhos, rodapés, notas de rodapé e números de página; produz títulos, parágrafos, listas, tabelas e texto em ordem de leitura legível por humanos para layouts de coluna única, múltiplas colunas e complexos.
- **Extração de fórmulas e tabelas**: Converte automaticamente fórmulas para LaTeX e tabelas para HTML, incluindo mesclagem de tabelas entre páginas e reconhecimento de conteúdo de tabelas.
- **Motor OCR**: Detecta automaticamente PDFs digitalizados ou corrompidos e habilita OCR, com suporte a 109 idiomas. O backend do pipeline usa PP-OCRv6 a partir da versão 3.4.
- **Backends de inferência duplos**: Oferece três modos — `pipeline` (baseado em regras, rápido, compatível com CPU/GPU), `vlm-engine` (baseado em VLM, alta precisão, suporta vLLM/LMDeploy/mlx) e `hybrid-engine` (combina extração de texto nativa com VLM para baixa alucinação).
- **Escolhas de modelos**: Os modelos VLM incluem a série MinerU2.5-Pro; a versão 3.3 introduziu um parâmetro `effort` (medium/high) para equilibrar velocidade e precisão.
## Integração e Implantação
- **SDKs e interfaces**: SDKs Python/Go/TypeScript, CLI, REST API, Docker e uma Gradio WebUI.
- **Frameworks**: Integrações nativas com LangChain, LlamaIndex, RAGFlow, Dify, FastGPT, Flowise e MCP Server para ferramentas de codificação com IA como Cursor, Claude Desktop e Windsurf.
- **Roteamento e escalabilidade**: Inclui `mineru-api` para endpoints de tarefas síncronas e assíncronas, e `mineru-router` para entrada unificada e balanceamento de carga entre múltiplos serviços e GPUs. Inferência concorrente multithread é suportada.
- **Suporte de plataforma**: Executa em Windows, Linux e macOS, incluindo ambientes somente CPU e aceleração GPU/MPS.
- **Implantação privada/offline**: Os modelos podem ser baixados e armazenados em cache localmente; suporta chips de IA domésticos como Ascend, Cambricon, Enflame, MetaX, Moore Threads, Kunlunxin, Iluvatar, Hygon, Biren e T-Head.
## Licença e Origens
MinerU originou-se do projeto de pré-treinamento InternLM e é mantido pela OpenDataLab. A partir da versão 3.1.0, usa uma licença de código aberto personalizada baseada na Apache 2.0 (anteriormente AGPLv3). Um aplicativo web online, cliente desktop e API estão disponíveis em mineru.net, com demos no Hugging Face e ModelScope.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.