প্রকল্প সম্পর্কে

Dolphin হলো ByteDance-এর খোলা-উৎস ডকুমেন্ট ইমেজ পার্সিং মডেল, যা ACL 2025 কাগজ "Document Image Parsing via Heterogeneous Anchor Prompting"-এ উপস্থাপিত হয়েছে। এটি ডকুমেন্ট ইমেজ—ডিজিটাল জন্মগ্রহিত এবং ছবি তোলা উভয়ই—কে JSON এবং Markdown-এর মতো কাঠামোবদ্ধ আউটপুটে রূপান্তর করে, যেখানে টেক্সট অনুচ্ছেদ, চিত্র, সূত্র, টেবিল এবং কোড ব্লকের মতো জটিলভাবে জড়িত উপাদানগুলোর চ্যালেঞ্জ মোকাবিলা করা হয়। মডেলটি একটি একক ভিশন-ভাষা মডেলের উপর নির্মিত ডকুমেন্ট-ধরন-সচেতন দুই-ধাপের আর্কিটেকচার ব্যবহার করে। ধাপ 1-এ ডকুমেন্টের ধরন শ্রেণিবিন্যাস করা হয় (ডিজিটাল বনাম ছবি তোলা) এবং পঠন ক্রম পূর্বাভাস সহ লেআউট বিশ্লেষণ করা হয়。 ধাপ 2-এ একটি হাইব্রিড পার্সিং কৌশল প্রয়োগ করা হয়: ছবি তোলা ডকুমেন্টের জন্য সামগ্রিক পার্সিং এবং ডিজিটাল ডকুমেন্টের জন্য সমান্তরাল উপাদান-ভিত্তিক পার্সিং, বিভিন্ন উপাদানের ধরনের জন্য বিশেষভাবে তৈরি হেটারোজিনিয়াস অ্যাংকর প্রম্পট ব্যবহার করে। সমান্তরাল পার্সিং মেকানিজমটি হালকা আর্কিটেকচার সত্ত্বেও অনুমান দক্ষতা বজায় রাখার পদ্ধতির অংশ। সংস্করণ ইতিহাস: মূল Dolphin (0.3B প্যারামিটার) মে 2025-এ প্রকাশিত হয়েছিল; Dolphin-1.5 (অক্টোবর 2025) 0.3B আকার বজায় রেখে পার্সিং মান উন্নত করেছে; Dolphin-v2 (ডিসেম্বর 2025) 3B p্যারামিটারে স্কেল করে এবং 21-উপাদান শনাক্তকরণ, বৈশিষ্ট্য ক্ষেত্র নিষ্কাশন, নিবেদিত সূত্র এবং কোড পার্সিং, এবং আরও দৃঢ় ছবি তোলা ডকুমেন্ট পার্সিং যোগ করেছে। পুরনো সংস্করণগুলো আলাদা শাখায় উপলব্ধ থাকছে। প্রকল্পটি Fox-Page বেনচমার্কও প্রকাশ করেছে, যা Fox ডেটাসেটের একটি হাতে পরিমার্জিত উপসেট যা ডকুমেন্ট পার্সিং মূল্যায়নের জন্য ব্যবহৃত হয়। OmniDocBench (v1.5)-এ, README-তে Dolphin-এর সামগ্রিক স্কোর 74.67, Dolphin-1.5-এর 85.06 এবং Dolphin-v2-এর 89.78 রিপোর্ট করা হয়েছে, সংস্করণগুলোর মধ্যে টেক্সট এডিট দূরত্ব, সূত্র CDM, টেবিল TEDS/TEDS-S এবং পঠন ক্রম মেট্রিক্সে সংশ্লিষ্ট উন্নতি সহ। ব্যবহার: রিপোজিটরিটি তিনটি সূক্ষ্মতার স্ক্রিপ্ট প্রদান করে—পাতা-স্তরের পার্সিং (পুরো পাতা বা বহু-পাতার PDF কে কাঠামোবদ্ধ JSON/Markdown-এ রূপান্তর, সমান্তরাল উপাদান ডিকোডিংয়ের জন্য কনফিগারযোগ্য ব্যাচ সাইজ সহ), উপাদান-স্তরের পার্সিং (ব্যক্তিগত টেক্সট, টেবিল, সূত্র বা কোড উপাদান), এবং লেআউট পার্সিং। প্রাক-প্রশিক্ষিত মডেলগুলো Hugging Face-এ বিতরণ করা হয়েছে (ByteDance/Dolphin-v2) এবং Hugging Face Transformers-এর জন্য সমর্থন করে। ত্বরান্বিত অনুমানের জন্য, প্রকল্পটি vLLM এবং TensorRT-LLM-এর জন্য ডিপ্লয়মেন্ট গাইড অন্তর্ভুক্ত করেছে। ইনস্টলেশন স্ট্যান্ডার্ড: রিপোজিটরি ক্লোন করুন, pip নির্ভরতা ইনস্টল করুন, এবং Hugging Face Hub থেকে মডেল ডাউনলোড করুন। কোডটি MIT-লাইসেন্সধারী, এবং রক্ষণাবেক্ষণকারীরা ব্যবহারকারীদের GitHub ইস্যুতে খারাপ কেস রিপোর্ট করার জন্য সক্রিয়ভাবে আমন্ত্রণ জানাচ্ছেন যাতে মডেল উন্নয়ন আরও পরিচালিত হয়। প্রকল্পটি OmniDocBench, Donut, Nougat, GOT-OCR2.0, MinerU এবং Swin Transformer-সহ সম্পর্কিত খোলা-উৎস প্রচেষ্টাগুলিকে স্বীকৃতি জানিয়েছে।