منصوبے کے بارے میں
Qwen3-VL علی بابا کلاؤڈ کی کیوین ٹیم کا ملٹی موڈل لارج لینگویج ماڈل سیریز ہے۔ یہ ریپوزٹری ماڈل فیملی، اس کی صلاحیتوں، آرکیٹیکچر اپ ڈیٹس، بینچ مارکس، کک بکس، اور ٹرانسفارمرز اور ماڈل اسکوپ کے ساتھ انفرنس کے لیے کوئیک اسٹارٹ کوڈ دستاویز کرتی ہے۔
ماڈل فیملی اور ریلیزز
یہ سیریز کئی سائز اور آرکیٹیکچرز پر محیط ہے، جسے ایج سے کلاؤڈ تک پیمانے کے طور پر بیان کیا گیا ہے۔ جاری کردہ چیک پوائنٹس میں Qwen3-VL-2B، 4B، 8B، 32B، 30B-A3B، اور 235B-A22B شامل ہیں، ہر ایک انسٹرکٹ اور تھنکنگ ایڈیشن میں دستیاب ہے۔ FP8 ورژن بھی درج ہیں۔ خبروں کے حصے میں حوالہ دی گئی پچھلی نسلوں میں Qwen2.5-VL، Qwen2-VL، اور QvQ-72B-Preview شامل ہیں۔
دستاویزی صلاحیتیں
- بصری ایجنٹ رویہ: عناصر کو پہچان کر، افعال کو سمجھ کر، ٹولز کو استعمال کر کے، اور کام مکمل کر کے PC اور موبائل GUI چلانا۔
- بصری کوڈنگ: تصاویر یا ویڈیوز سے Draw.io، HTML، CSS، اور JS تیار کرنا۔
- مقامی ادراک: اشیاء کی پوزیشن، نقطہ نظر، اور رکاوٹوں کا فیصلہ کرنا، 2D گراؤنڈنگ اور 3D گراؤنڈنگ کے ساتھ مقامی استدلال اور ایمبوڈیڈ AI کے لیے۔
- طویل سیاق اور ویڈیو: مقامی 256K سیاق جو 1M تک بڑھایا جا سکتا ہے، کتابوں اور گھنٹوں طویل ویڈیو کو سیکنڈ لیول انڈیکسنگ کے ساتھ سنبھالنا۔
- ملٹی موڈل استدلال: STEM اور ریاضی کے کام جن میں وجہ تجزیہ اور ثبوت پر مبنی جوابات شامل ہیں۔
- بصری شناخت: مشہور شخصیات، اینیمے، مصنوعات، تاریخی مقامات، اور نباتات/حیوانات کے لیے وسیع پری ٹریننگ کوریج۔
- OCR: 32 زبانوں کے لیے معاونت، کم روشنی، دھندلاپن، اور جھکاؤ میں مضبوطی، نیز طویل دستاویز کی ساخت پارسنگ۔
- متن کی فہم کو خالص LLMs کے برابر بیان کیا گیا ہے، متن-بصری فیوژن کے ذریعے۔
آرکیٹیکچر اپ ڈیٹس
README میں تین آرکیٹیکچرل عناصر درج ہیں: Interleaved-MRoPE وقت، چوڑائی، اور اونچائی میں مکمل فریکوئنسی پوزیشن مختص کے لیے؛ DeepStack ملٹی لیول ViT خصوصیات کو فیوز کرنے کے لیے؛ اور Text-Timestamp Alignment ویڈیو میں ٹائم اسٹیمپ پر مبنی واقعہ لوکلائزیشن کے لیے۔
کک بکس
Jupyter نوٹ بکس کا ایک سیٹ اومنی ریکگنیشن، دستاویز پارسنگ، 2D گراؤنڈنگ، OCR اور کلیدی معلومات نکالنا، ویڈیو فہم، موبائل ایجنٹ، کمپیوٹر استعمال ایجنٹ، 3D گراؤنڈنگ، تصاویر کے ساتھ سوچنا، ملٹی موڈل کوڈنگ، طویل دستاویز فہم، اور مقامی فہم کا احاطہ کرتا ہے۔ ہر ایک Colab بیج کے ساتھ منسلک ہے۔
کوئیک اسٹارٹ
استعمال کے لیے transformers >= 4.57.0 درکار ہے۔ مثالیں AutoModelForImageTextToText اور AutoProcessor کے ساتھ لوڈنگ، چیٹ ٹیمپلیٹ لگانے، اور آؤٹ پٹ تیار کرنے کو دکھاتی ہیں۔ اضافی حصے ملٹی امیج انفرنس، ویڈیو انفرنس، بائیں پیڈنگ کے ساتھ بیچ انفرنس، اور تصاویر اور ویڈیوز کے لیے سرکاری پروسیسر کے ذریعے پکسل بجٹ کنٹرول، بشمول fps اور num_frames سیٹنگز کا احاطہ کرتے ہیں۔ qwen-vl-utils ٹول کٹ (ورژن 0.0.14) کو image_patch_size اور return_video_metadata اختیارات کے ساتھ دستاویز کیا گیا ہے۔
وسائل
ریپوزٹری Qwen Chat، Hugging Face اور ModelScope مجموعے، ایک بلاگ پوسٹ، ایک arXiv پیپر، ایک ڈیمو Space، WeChat، Discord، ایک API حوالہ، اور PAI-DSW سے لنک کرتی ہے۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.