À propos du projet
Dolphin est un modèle open source de ByteDance pour l'analyse d'images de documents, présenté dans l'article ACL 2025 intitulé « Document Image Parsing via Heterogeneous Anchor Prompting ». Il convertit des images de documents—qu'elles soient nativement numériques ou photographiées—en sorties structurées comme JSON et Markdown, répondant au défi des éléments complexes entrelacés tels que les paragraphes de texte, les figures, les formules, les tableaux et les blocs de code.
Le modèle utilise une architecture en deux étapes sensible au type de document, basée sur un modèle vision-langage unique. L'étape 1 classifie le type de document (numérique ou photographié) et effectue l'analyse de mise en page avec prédiction de l'ordre de lecture. L'étape 2 applique une stratégie d'analyse hybride : une analyse holistique pour les documents photographiés et une analyse parallèle élément par élément pour les documents numériques, utilisant des invites d'ancrage hétérogènes adaptées aux différents types d'éléments. Le mécanisme d'analyse parallèle contribue à l'efficacité de l'inférence malgré une architecture légère.
Historique des versions : le Dolphin original (0,3B paramètres) a été publié en mai 2025 ; Dolphin-1.5 (octobre 2025) a conservé la taille de 0,3B tout en améliorant la qualité d'analyse ; Dolphin-v2 (décembre 2025) passe à 3B paramètres et ajoute la détection de 21 éléments, l'extraction d'attributs, des analyses dédiées pour les formules et le code, ainsi qu'une analyse plus robuste des documents photographiés. Les anciennes versions restent disponibles sur des branches séparées. Le projet a également publié le benchmark Fox-Page, un sous-ensemble raffiné manuellement du jeu de données Fox pour l'évaluation de l'analyse de documents.
Sur OmniDocBench (v1.5), le README rapporte des scores globaux de 74,67 pour Dolphin, 85,06 pour Dolphin-1.5 et 89,78 pour Dolphin-v2, avec des améliorations correspondantes dans la distance d'édition du texte, le CDM des formules, le TEDS/TEDS-S des tableaux et les métriques d'ordre de lecture selon les versions.
Utilisation : le dépôt fournit des scripts pour trois granularités—analyse au niveau de la page (pages entières ou PDF multipages en JSON/Markdown structuré, avec une taille de lot configurable pour le décodage parallèle des éléments), analyse au niveau de l'élément (texte, tableau, formule ou élément de code individuel) et analyse de mise en page. Les modèles préentraînés sont distribués sur Hugging Face (ByteDance/Dolphin-v2) et prennent en charge Hugging Face Transformers pour l'intégration. Pour une inférence accélérée, le projet inclut des guides de déploiement pour vLLM et TensorRT-LLM. L'installation est standard : cloner le dépôt, installer les exigences pip et télécharger le modèle depuis le hub Hugging Face.
Le code est sous licence MIT, et les mainteneurs invitent activement les utilisateurs à signaler des cas problématiques via les issues GitHub pour guider les améliorations futures du modèle. Le projet reconnaît les efforts open source connexes, notamment OmniDocBench, Donut, Nougat, GOT-OCR2.0, MinerU et Swin Transformer.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.