इस प्रोजेक्ट के बारे में

डॉल्फिन बाइटडांस का ओपन-सोर्स दस्तावेज़ छवि पार्सिंग मॉडल है, जिसे ACL 2025 पेपर "Document Image Parsing via Heterogeneous Anchor Prompting" में पेश किया गया है। यह दस्तावेज़ छवियों—चाहे वे डिजिटल रूप से निर्मित हों या फोटो खींची गई हों—को JSON और Markdown जैसे संरचित आउटपुट में परिवर्तित करता है, जिससे पाठ अनुच्छेद, आंकड़े, सूत्र, तालिकाएं और कोड ब्लॉक जैसे जटिल रूप से जुड़े तत्वों की चुनौती का समाधान होता है। मॉडल एकल विज़न-भाषा मॉडल पर निर्मित दस्तावेज़-प्रकार-जागरूक दो-चरणीय आर्किटेक्चर का उपयोग करता है। चरण 1 दस्तावेज़ प्रकार (डिजिटल बनाम फोटो खींचा गया) को वर्गीकृत करता है और पढ़ने के क्रम की भविष्यवाणी के साथ लेआउट विश्लेषण करता है। चरण 2 एक हाइब्रिड पार्सिंग रणनीति लागू करता है: फोटो खींचे गए दस्तावेज़ों के लिए समग्र पार्सिंग और डिजिटल दस्तावेज़ों के लिए समानांतर तत्व-वार पार्सिंग, विभिन्न तत्व प्रकारों के अनुरूप विषम एंकर प्रॉम्प्ट का उपयोग करते हुए। समानांतर पार्सिंग तंत्र उस तरीके का हिस्सा है जिससे परियोजना हल्के आर्किटेक्चर के बावजूद अनुमान को कुशल बनाए रखती है। संस्करण इतिहास: मूल डॉल्फिन (0.3B पैरामीटर) मई 2025 में जारी किया गया था; डॉल्फिन-1.5 (अक्टूबर 2025) ने 0.3B आकार बनाए रखा जबकि पार्सिंग गुणवत्ता में सुधार किया; डॉल्फिन-v2 (दिसंबर 2025) 3B पैरामीटर तक स्केल करता है और 21-तत्व पहचान, विशेषता क्षेत्र निष्कर्षण, समर्पित सूत्र और कोड पार्सिंग, और अधिक मजबूत फोटो खींचे गए दस्तावेज़ पार्सिंग जोड़ता है। पुराने संस्करण अलग-अलग शाखाओं पर उपलब्ध रहते हैं। परियोजना ने Fox-Page बेंचमार्क भी जारी किया है, जो दस्तावेज़ पार्सिंग मूल्यांकन के लिए Fox डेटासेट का मैन्युअल रूप से परिष्कृत उपसमुच्चय है। OmniDocBench (v1.5) पर, README डॉल्फिन के लिए 74.67, डॉल्फिन-1.5 के लिए 85.06, और डॉल्फिन-v2 के लिए 89.78 के समग्र स्कोर की रिपोर्ट करता है, जिसमें संस्करणों में पाठ संपादन दूरी, सूत्र CDM, तालिका TEDS/TEDS-S, और पढ़ने के क्रम मेट्रिक्स में संबंधित सुधार शामिल हैं। उपयोग: रिपॉजिटरी तीन ग्रैन्युलैरिटी के लिए स्क्रिप्ट प्रदान करती है—पृष्ठ-स्तरीय पार्सिंग (पूरे पृष्ठ या बहु-पृष्ठ पीडीएफ़ को संरचित JSON/Markdown में, समानांतर तत्व डिकोडिंग के लिए कॉन्फ़िगर करने योग्य बैच आकार के साथ), तत्व-स्तरीय पार्सिंग (व्यक्तिगत पाठ, तालिका, सूत्र, या कोड तत्व), और लेआउट पार्सिंग। प्रशिक्षित मॉडल Hugging Face (ByteDance/Dolphin-v2) पर वितरित किए जाते हैं और एकीकरण के लिए Hugging Face Transformers का समर्थन करते हैं। त्वरित अनुमान के लिए, परियोजना में vLLM और TensorRT-LLM के लिए तैनाती गाइड शामिल हैं। स्थापना मानक है: रिपॉजिटरी क्लोन करें, pip आवश्यकताएं स्थापित करें, और Hugging Face Hub से मॉडल डाउनलोड करें। कोड MIT-लाइसेंस प्राप्त है, और अनुरक्षक सक्रिय रूप से उपयोगकर्ताओं को GitHub मुद्दों के माध्यम से खराब मामलों की रिपोर्ट करने के लिए आमंत्रित करते हैं ताकि आगे मॉडल सुधार का मार्गदर्शन किया जा सके। परियोजना OmniDocBench, Donut, Nougat, GOT-OCR2.0, MinerU, और Swin Transformer सहित संबंधित ओपन-सोर्स प्रयासों को स्वीकार करती है।