Sobre o projeto

MinerU é um motor de análise de documentos de alta precisão projetado para converter formatos de documentos complexos em dados estruturados legíveis por máquina para fluxos de trabalho downstream de LLM, RAG e agentes. Ele suporta nativamente entradas PDF, imagens, DOCX, PPTX e XLSX, e produz Markdown ou JSON com preservação da ordem de leitura. ## Principais Capacidades - **Análise nativa multiformato**: Lida com PDF, documentos digitalizados, imagens, DOCX, PPTX e XLSX sem exigir conversão prévia para PDF. - **Preservação de estrutura**: Remove cabeçalhos, rodapés, notas de rodapé e números de página; produz títulos, parágrafos, listas, tabelas e texto em ordem de leitura legível por humanos para layouts de coluna única, múltiplas colunas e complexos. - **Extração de fórmulas e tabelas**: Converte automaticamente fórmulas para LaTeX e tabelas para HTML, incluindo mesclagem de tabelas entre páginas e reconhecimento de conteúdo de tabelas. - **Motor OCR**: Detecta automaticamente PDFs digitalizados ou corrompidos e habilita OCR, com suporte a 109 idiomas. O backend do pipeline usa PP-OCRv6 a partir da versão 3.4. - **Backends de inferência duplos**: Oferece três modos — `pipeline` (baseado em regras, rápido, compatível com CPU/GPU), `vlm-engine` (baseado em VLM, alta precisão, suporta vLLM/LMDeploy/mlx) e `hybrid-engine` (combina extração de texto nativa com VLM para baixa alucinação). - **Escolhas de modelos**: Os modelos VLM incluem a série MinerU2.5-Pro; a versão 3.3 introduziu um parâmetro `effort` (medium/high) para equilibrar velocidade e precisão. ## Integração e Implantação - **SDKs e interfaces**: SDKs Python/Go/TypeScript, CLI, REST API, Docker e uma Gradio WebUI. - **Frameworks**: Integrações nativas com LangChain, LlamaIndex, RAGFlow, Dify, FastGPT, Flowise e MCP Server para ferramentas de codificação com IA como Cursor, Claude Desktop e Windsurf. - **Roteamento e escalabilidade**: Inclui `mineru-api` para endpoints de tarefas síncronas e assíncronas, e `mineru-router` para entrada unificada e balanceamento de carga entre múltiplos serviços e GPUs. Inferência concorrente multithread é suportada. - **Suporte de plataforma**: Executa em Windows, Linux e macOS, incluindo ambientes somente CPU e aceleração GPU/MPS. - **Implantação privada/offline**: Os modelos podem ser baixados e armazenados em cache localmente; suporta chips de IA domésticos como Ascend, Cambricon, Enflame, MetaX, Moore Threads, Kunlunxin, Iluvatar, Hygon, Biren e T-Head. ## Licença e Origens MinerU originou-se do projeto de pré-treinamento InternLM e é mantido pela OpenDataLab. A partir da versão 3.1.0, usa uma licença de código aberto personalizada baseada na Apache 2.0 (anteriormente AGPLv3). Um aplicativo web online, cliente desktop e API estão disponíveis em mineru.net, com demos no Hugging Face e ModelScope.