منصوبے کے بارے میں
Dolphin ByteDance کا اوپن سورس دستاویزی تصویر پارسنگ ماڈل ہے، جو ACL 2025 کے مقالے "Document Image Parsing via Heterogeneous Anchor Prompting" میں متعارف کرایا گیا۔ یہ دستاویزی تصاویر—چاہے وہ ڈیجیٹل ہوں یا تصویر شدہ—کو JSON اور Markdown جیسے ساختہ آؤٹ پٹ میں تبدیل کرتا ہے، اور متن کے پیراگراف، تصاویر، فارمولے، جدولوں، اور کوڈ بلاکس جیسے پیچیدہ طور پر جڑے عناصر کے چیلنج سے نمٹتا ہے۔
ماڈل ایک واحد وژن-لینگویج ماڈل پر مبنی دستاویز-قسم سے آگاہ دو مرحلہ فن تعمیر استعمال کرتا ہے۔ مرحلہ 1 دستاویز کی قسم (ڈیجیٹل بمقابلہ تصویر شدہ) کی درجہ بندی کرتا ہے اور پڑھنے کی ترتیب کی پیش گوئی کے ساتھ ترتیب کا تجزیہ کرتا ہے۔ مرحلہ 2 ایک ہائبرڈ پارسنگ حکمت عملی لاگو کرتا ہے: تصویر شدہ دستاویزات کے لیے مکمل پارسنگ اور ڈیجیٹل دستاویزات کے لیے متوازی عنصر-وار پارسنگ، مختلف عنصر کی اقسام کے مطابق مختلف اینکر پرامپٹس استعمال کرتے ہوئے۔ متوازی پارسنگ میکانزم اس بات کا حصہ ہے کہ پروجیکٹ ہلکے فن تعمیر کے باوجود تخمینہ کو موثر کیسے رکھتا ہے۔
ورژن کی تاریخ: اصل Dolphin (0.3B پیرامیٹرز) مئی 2025 میں جاری کیا گیا؛ Dolphin-1.5 (اکتوبر 2025) نے 0.3B سائز برقرار رکھا جبکہ پارسنگ معیار کو بہتر کیا؛ Dolphin-v2 (دسمبر 2025) 3B پیرامیٹرز تک پیمانہ کرتا ہے اور 21-عنصر کی شناخت، خصوصیت فیلڈ نکالنا، مخصوص فارمولہ اور کوڈ پارسنگ، اور تصویر شدہ دستاویزات کی زیادہ مضبوط پارسنگ شامل کرتا ہے۔ پرانے ورژن علیحدہ شاخوں پر دستیاب رہتے ہیں۔ پروجیکٹ نے Fox-Page بینچ مارک بھی جاری کیا ہے، جو دستاویز پارسنگ تشخیص کے لیے Fox ڈیٹاسیٹ کا دستی طور پر بہتر ذیلی سیٹ ہے۔
OmniDocBench (v1.5) پر، README مجموعی اسکور 74.67 Dolphin کے لیے، 85.06 Dolphin-1.5 کے لیے، اور 89.78 Dolphin-v2 کے لیے رپورٹ کرتا ہے، جس میں متن کی ترمیم فاصلہ، فارمولہ CDM، جدول TEDS/TEDS-S، اور پڑھنے کی ترتیب کے میٹرکس میں ورژن کے مطابق بہتری آئی ہے۔
استعمال: ریپوزٹری تین درجہ بندیوں کے لیے اسکرپٹ فراہم کرتی ہے—صفحہ-سطح پارسنگ (مکمل صفحات یا کثیر-صفحہ PDFs کو ساختہ JSON/Markdown میں، متوازی عنصر ڈی کوڈنگ کے لیے قابل ترتیب بیچ سائز کے ساتھ)، عنصر-سطح پارسنگ (انفرادی متن، جدول، فارمولہ، یا کوڈ عناصر)، اور ترتیب پارسنگ۔ پہلے سے تربیت یافتہ ماڈل Hugging Face (ByteDance/Dolphin-v2) پر تقسیم کیے گئے ہیں اور انضمام کے لیے Hugging Face Transformers کو سپورٹ کرتے ہیں۔ تیز تخمینہ کے لیے، پروجیکٹ میں vLLM اور TensorRT-LLM کے لیے تعیناتی گائیڈز شامل ہیں۔ انسٹالیشن معیاری ہے: ریپوزٹری کلون کریں، pip تقاضے انسٹال کریں، اور Hugging Face Hub سے ماڈل ڈاؤن لوڈ کریں۔
کوڈ MIT-لائسنس یافتہ ہے، اور منتظمین فعال طور پر صارفین کو GitHub مسائل کے ذریعے خراب کیسز رپورٹ کرنے کی دعوت دیتے ہیں تاکہ ماڈل کی مزید بہتری کی رہنمائی ہو۔ پروجیکٹ متعلقہ اوپن سورس کوششوں کو تسلیم کرتا ہے جن میں OmniDocBench، Donut، Nougat، GOT-OCR2.0، MinerU، اور Swin Transformer شامل ہیں۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.