À propos du projet
dots.ocr est un modèle vision-langage open-source axé sur le parsing de mise en page documentaire. Selon son README, il est conçu pour une accessibilité universelle et peut reconnaître une large gamme d'écritures humaines. Il rapporte de bons résultats sur les benchmarks multilingues de parsing documentaire parmi les modèles de taille comparable, et il gère également les graphiques structurés tels que les diagrammes en les convertissant en code SVG, ainsi que les captures d'écran web et le texte de scène.
Capacités clés décrites dans le README :
- Parsing documentaire multilingue : extrait des éléments de mise en page avec boîtes englobantes, catégories et contenu textuel à partir d'images et de PDFs.
- Les catégories de mise en page incluent Légende, Note de bas de page, Formule, Élément de liste, Pied de page, En-tête de page, Image, En-tête de section, Tableau, Texte et Titre.
- Formatage de sortie : formules en LaTeX, tableaux en HTML, et autres textes en Markdown, avec éléments triés dans l'ordre de lecture humain.
- Parsing de graphiques structurés : convertit les diagrammes, graphiques, formules chimiques et logos en code SVG.
- Tâches supplémentaires : parsing de pages web et détection de texte de scène.
- La réponse à des questions visuelles générales est également prise en charge.
Déploiement et utilisation :
- Installation via conda et pip, avec une image Docker proposée en alternative.
- Les poids du modèle peuvent être téléchargés avec un script fourni, incluant une option ModelScope.
- vLLM est recommandé pour le déploiement ; le README indique que dots.ocr a été intégré dans vLLM depuis la version 0.11.0.
- L'inférence Hugging Face Transformers est prise en charge, y compris un chemin d'inférence CPU référencé dans un problème.
- Un script de parsing peut traiter une seule image ou un PDF, avec des options pour la détection de mise en page uniquement ou le parsing de texte seul, et peut produire du JSON structuré, du Markdown et une image de visualisation de mise en page.
- Une démo en direct est disponible.
Le README liste également des limitations : les tableaux complexes et les formules mathématiques restent difficiles en raison de l'architecture compacte du modèle, le parsing basé sur SVG des graphiques structurés n'est pas encore entièrement robuste, et des échecs de parsing occasionnels peuvent encore se produire. Il note que dots.ocr-1.5 a ensuite été renommé dots.mocr, avec des poids mis à jour et un article.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.