عن المشروع
Qwen3-VL هي سلسلة نماذج اللغة الكبيرة متعددة الوسائط من فريق Qwen في Alibaba Cloud. يوثق المستودع عائلة النماذج، وقدراتها، وتحديثات البنية، والمعايير، وكتب الطبخ، وكود البدء السريع للاستدلال باستخدام Transformers وModelScope.
عائلة النماذج والإصدارات
تمتد السلسلة عبر أحجام وبنى متعددة، موصوفة بأنها تتوسع من الحافة إلى السحابة. تشمل نقاط التحقق المنشورة Qwen3-VL-2B و4B و8B و32B و30B-A3B و235B-A22B، كل منها متاح في إصدارات Instruct وThinking. كما تُدرج إصدارات FP8. الأجيال السابقة المذكورة في قسم الأخبار تشمل Qwen2.5-VL وQwen2-VL وQvQ-72B-Preview.
القدرات الموثقة
- سلوك الوكيل البصري: تشغيل واجهات المستخدم الرسومية للحاسوب والهاتف المحمول من خلال التعرف على العناصر، وفهم الوظائف، واستدعاء الأدوات، وإكمال المهام.
- البرمجة البصرية: توليد Draw.io وHTML وCSS وJS من الصور أو الفيديو.
- الإدراك المكاني: الحكم على مواقع الأشياء ووجهات النظر والإخفاءات، مع التثبيت ثنائي الأبعاد والتثبيت ثلاثي الأبعاد للاستدلال المكاني والذكاء الاصطناعي المجسد.
- السياق الطويل والفيديو: سياق أصلي 256K قابل للتوسيع إلى 1M، مع معالجة الكتب والفيديو الطويل بساعات مع فهرسة على مستوى الثانية.
- الاستدلال متعدد الوسائط: مهام STEM والرياضيات مع تحليل سببي وإجابات مبنية على الأدلة.
- التعرف البصري: تغطية واسعة للتدريب المسبق للمشاهير والأنمي والمنتجات والمعالم والنباتات والحيوانات.
- OCR: دعم 32 لغة، ومتانة في الإضاءة المنخفضة والضبابية والإمالة، بالإضافة إلى تحليل بنية المستندات الطويلة.
- فهم النص الموصوف بأنه على قدم المساواة مع نماذج اللغة النقية من خلال دمج النص والرؤية.
تحديثات البنية
يسرد ملف README ثلاثة عناصر معمارية: Interleaved-MRoPE للتخصيص الموضعي للتردد الكامل عبر الزمن والعرض والارتفاع؛ وDeepStack لدمج ميزات ViT متعددة المستويات؛ ومحاذاة الطابع الزمني للنص لتحديد موقع الأحداث المستند إلى الطابع الزمني في الفيديو.
كتب الطبخ
تغطي مجموعة من دفاتر Jupyter التعرف الشامل، وتحليل المستندات، والتثبيت ثنائي الأبعاد، وOCR واستخراج المعلومات الأساسية، وفهم الفيديو، والوكيل المحمول، ووكيل استخدام الحاسوب، والتثبيت ثلاثي الأبعاد، والتفكير بالصور، والبرمجة متعددة الوسائط، وفهم المستندات الطويلة، والفهم المكاني. كل منها مرتبط بشارة Colab.
البدء السريع
يتطلب الاستخدام transformers >= 4.57.0. تعرض الأمثلة التحميل باستخدام AutoModelForImageTextToText وAutoProcessor، وتطبيق قالب الدردشة، وتوليد المخرجات. تغطي الأقسام الإضافية الاستدلال متعدد الصور، والاستدلال بالفيديو، والاستدلال الدفعي مع الحشو الأيسر، والتحكم في ميزانية البكسل من خلال المعالج الرسمي للصور والفيديو، بما في ذلك إعدادات fps وnum_frames. تم توثيق مجموعة أدوات qwen-vl-utils (الإصدار 0.0.14) مع خيارات image_patch_size وreturn_video_metadata.
الموارد
يربط المستودع بـ Qwen Chat، ومجموعات Hugging Face وModelScope، ومنشور مدونة، وورقة arXiv، ومساحة عرض، وWeChat، وDiscord، ومرجع API، وPAI-DSW.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.