منصوبے کے بارے میں

dots.ocr ایک اوپن سورس وژن-لینگویج ماڈل ہے جو دستاویز لے آؤٹ پارسنگ پر مرکوز ہے۔ اس کے README کے مطابق، یہ عالمی رسائی کے لیے ڈیزائن کیا گیا ہے اور انسانی رسم الخط کی وسیع رینج کو پہچان سکتا ہے۔ یہ اسی سائز کے ماڈلز کے درمیان کثیر لسانی دستاویز پارسنگ بینچ مارکس پر مضبوط نتائج رپورٹ کرتا ہے، اور یہ چارٹس اور ڈایاگرامس جیسے ساختی گرافکس کو SVG کوڈ میں تبدیل کرکے، نیز ویب اسکرینز اور سین ٹیکسٹ کو بھی سنبھالتا ہے۔ README میں بیان کردہ اہم صلاحیتیں: - کثیر لسانی دستاویز پارسنگ: تصاویر اور PDFs سے باؤنڈنگ باکسز، زمرہ جات اور متن کے مواد کے ساتھ لے آؤٹ عناصر نکالتا ہے۔ - لے آؤٹ زمرہ جات میں Caption، Footnote، Formula، List-item، Page-footer، Page-header، Picture، Section-header، Table، Text اور Title شامل ہیں۔ - آؤٹ پٹ فارمیٹنگ: فارمولے LaTeX کے طور پر، جدولیں HTML کے طور پر، اور دیگر متن Markdown کے طور پر، عناصر انسانی پڑھنے کی ترتیب میں ترتیب دیے گئے۔ - ساختی گرافکس پارسنگ: چارٹس، ڈایاگرامس، کیمیائی فارمولے اور لوگو کو SVG کوڈ میں تبدیل کرتا ہے۔ - اضافی کام: ویب پیج پارسنگ اور سین ٹیکسٹ اسپاٹنگ۔ - عمومی وژن سوال جواب بھی سپورٹ کیا جاتا ہے۔ تعیناتی اور استعمال: - conda اور pip کے ذریعے تنصیب، متبادل کے طور پر Docker امیج پیش کی گئی۔ - ماڈل وزن ایک فراہم کردہ اسکرپٹ کے ساتھ ڈاؤن لوڈ کیے جا سکتے ہیں، بشمول ModelScope آپشن۔ - تعیناتی کے لیے vLLM تجویز کیا جاتا ہے؛ README کہتا ہے کہ dots.ocr کو vLLM میں ورژن 0.11.0 سے ضم کیا گیا ہے۔ - Hugging Face Transformers انفرنس سپورٹ ہے، بشمول ایک CPU انفرنس پاتھ جو ایک مسئلے میں حوالہ دیا گیا ہے۔ - ایک پارسر اسکرپٹ ایک تصویر یا PDF پر کارروائی کر سکتا ہے، صرف لے آؤٹ ڈٹیکشن یا صرف متن پارسنگ کے اختیارات کے ساتھ، اور ساختی JSON، Markdown اور لے آؤٹ ویژولائزیشن امیج آؤٹ پٹ کر سکتا ہے۔ - ایک لائیو ڈیمو دستیاب ہے۔ README حدود بھی درج کرتا ہے: پیچیدہ جدولیں اور ریاضی کے فارمولے کمپیکٹ ماڈل آرکیٹیکچر کے پیش نظر مشکل رہتے ہیں، ساختی گرافکس کی SVG پر مبنی پارسنگ ابھی مکمل طور پر مضبوط نہیں ہے، اور کبھی کبھار پارسنگ ناکامیاں ہو سکتی ہیں۔ یہ نوٹ کرتا ہے کہ dots.ocr-1.5 کو بعد میں dots.mocr کے نام سے دوبارہ برانڈ کیا گیا، تازہ ترین وزن اور ایک مقالے کے ساتھ۔