منصوبے کے بارے میں

VLMEvalKit (Python پیکیج کا نام vlmeval) بڑے وژن-لینگویج ماڈلز (LVLMs) کے لیے ایک اوپن سورس جانچ ٹول کٹ ہے۔ اس کا بیان کردہ مقصد یہ ہے کہ محققین اور ڈویلپرز ہر ریپوزٹری کے لیے الگ سے ڈیٹا تیار کیے بغیر کئی بینچ مارکس پر LVLMs کی ایک کمانڈ سے جانچ کر سکیں۔ README کے مطابق یہ 220+ LMMs اور 80+ بینچ مارکس کو سپورٹ کرتا ہے، جس میں کمرشل APIs اور اوپن سورس ماڈلز شامل ہیں۔ جانچ کا طریقہ: یہ ٹول کٹ تمام LVLMs کے لیے جنریشن پر مبنی جانچ استعمال کرتی ہے اور exact matching اور LLM پر مبنی جواب نکالنے دونوں کے نتائج فراہم کرتی ہے۔ README میں نوٹ کیا گیا ہے کہ اس کا مقصد تھرڈ پارٹی بینچ مارکس کے اصل مقالات میں دیے گئے عین درست اعداد و شمار کو دوبارہ پیدا کرنا نہیں ہے، کیونکہ کچھ بینچ مارکس مختلف طریقے استعمال کرتے ہیں (مثلاً PPL پر مبنی جانچ) اور کیونکہ ماڈل کے لیے مخصوص ٹیمپلیٹ نافذ نہ ہونے تک تمام ماڈلز پر ایک ہی ڈیفالٹ پرامپٹ ٹیمپلیٹ استعمال ہوتا ہے۔ سپورٹ شدہ مواد: README میں تصویری اور ویڈیو بینچ مارکس (فیچرز ٹیبل کے مطابق 70+) اور سپورٹ شدہ LMMs (200+) کی فہرست دی گئی ہے، جن میں Qwen، InternVL، LLaVA، MiniCPM، Ovis، Gemini، Kimi-VL، LLaMA4، Phi، Grok اور دیگر شامل ہیں۔ حالیہ اضافوں میں Video-MME-v2، SeePhys، PhyX، InternVL3، Qwen2.5-VL، MMMU-Pro، CC-OCR اور بہت کچھ شامل ہے۔ فوری آغاز: ایک مختصر Python ڈیمو میں vlmeval.config سے supported_VLM درآمد کرنا، idefics_9b_instruct جیسا ماڈل بنانا، اور تصویر کے راستوں کے ساتھ سوال دے کر generate کال کرنا دکھایا گیا ہے۔ README میں انگریزی اور چینی میں Quickstart اور Development گائیڈز کی طرف بھی اشارہ کیا گیا ہے۔ ڈویلپمنٹ ماڈل: ماڈل شامل کرنے کے لیے ڈویلپر صرف ایک generate_inner() فنکشن نافذ کرتا ہے؛ ڈیٹا ڈاؤن لوڈنگ، پری پروسیسنگ، پیش گوئی کا استنباط اور میٹرک حساب کتاب کوڈ بیس سنبھالتا ہے۔ ماڈلز، بینچ مارکس یا اہم فیچرز کے تعاون کا اعتراف کیا جاتا ہے، اور تین یا زیادہ اہم تعاون دینے والے شراکت دار تکنیکی رپورٹ کی مصنف فہرست میں شامل ہو سکتے ہیں۔ عملی نوٹس: README مختلف ماڈل خاندانوں کے لیے مخصوص transformers ورژنز، نیز torchvision اور flash-attn کی رہنمائی تجویز کرتا ہے۔ یہ thinking-mode ماڈلز (SPLIT_THINK)، طویل جوابات (xlsx سیل کٹنے سے بچنے کے لیے PRED_FORMAT=tsv)، اور LMDeploy یا VLLM کے ذریعے بڑے پیمانے یا thinking ماڈلز کے لیے ملٹی نوڈ ڈسٹری بیوٹڈ استنباط کے لیے ماحولیاتی متغیرات کی دستاویز کرتا ہے۔ جانچ کے نتائج OpenVLM لیڈر بورڈز اور Hugging Face اسپیسز پر شائع ہوتے ہیں، تفصیلی نتائج ڈاؤن لوڈ کے قابل ہوتے ہیں۔ یہ پروجیکٹ ACM Multimedia 2024 کے ایک مقالے اور ایک Discord کمیونٹی سے وابستہ ہے۔