À propos du projet
MinerU est un moteur d'analyse documentaire de haute précision conçu pour convertir des formats de documents complexes en données structurées lisibles par machine pour les workflows en aval LLM, RAG et agents. Il prend en charge nativement les entrées PDF, images, DOCX, PPTX et XLSX, et produit du Markdown ou du JSON avec préservation de l'ordre de lecture.
## Capacités clés
- **Analyse native multi-format** : gère les PDF, documents scannés, images, DOCX, PPTX et XLSX sans nécessiter de conversion préalable en PDF.
- **Préservation de la structure** : supprime les en-têtes, pieds de page, notes de bas de page et numéros de page ; produit des titres, paragraphes, listes, tableaux et texte dans un ordre de lecture lisible par l'humain pour les mises en page à une colonne, multi-colonnes et complexes.
- **Extraction de formules et de tableaux** : convertit automatiquement les formules en LaTeX et les tableaux en HTML, y compris la fusion de tableaux sur plusieurs pages et la reconnaissance du contenu des tableaux.
- **Moteur OCR** : détecte automatiquement les PDF scannés ou illisibles et active l'OCR, avec prise en charge de 109 langues. Le backend pipeline utilise PP-OCRv6 à partir de la version 3.4.
- **Doubles backends d'inférence** : propose trois modes — `pipeline` (basé sur des règles, rapide, compatible CPU/GPU), `vlm-engine` (basé sur VLM, haute précision, prend en charge vLLM/LMDeploy/mlx) et `hybrid-engine` (combine l'extraction native de texte avec le VLM pour une faible hallucination).
- **Choix de modèles** : les modèles VLM incluent la série MinerU2.5-Pro ; la version 3.3 a introduit un paramètre `effort` (medium/high) pour équilibrer vitesse et précision.
## Intégration et déploiement
- **SDK et interfaces** : SDK Python/Go/TypeScript, CLI, REST API, Docker et une interface Web Gradio.
- **Frameworks** : intégrations natives avec LangChain, LlamaIndex, RAGFlow, Dify, FastGPT, Flowise et MCP Server pour les outils de codage IA comme Cursor, Claude Desktop et Windsurf.
- **Routage et mise à l'échelle** : inclut `mineru-api` pour les points de terminaison de tâches synchrones et asynchrones, et `mineru-router` pour une entrée unifiée et l'équilibrage de charge entre plusieurs services et GPU. L'inférence concurrente multithread est prise en charge.
- **Prise en charge des plateformes** : fonctionne sur Windows, Linux et macOS, y compris les environnements purement CPU et l'accélération GPU/MPS.
- **Déploiement privé/hors ligne** : les modèles peuvent être téléchargés et mis en cache localement ; prend en charge les puces IA nationales telles que Ascend, Cambricon, Enflame, MetaX, Moore Threads, Kunlunxin, Iluvatar, Hygon, Biren et T-Head.
## Licence et origines
MinerU est issu du projet de pré-entraînement InternLM et est maintenu par OpenDataLab. À partir de la version 3.1.0, il utilise une licence open source personnalisée basée sur Apache 2.0 (auparavant AGPLv3). Une application Web en ligne, un client de bureau et une API sont disponibles sur mineru.net, avec des démos sur Hugging Face et ModelScope.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.