منصوبے کے بارے میں

SAM 2 (Segment Anything Model 2) Meta AI / FAIR کا ایک فاؤنڈیشن ماڈل ہے جو تصاویر اور ویڈیوز دونوں میں قابلِ پرامپٹ بصری سیگمنٹیشن کے لیے ہے۔ یہ اصل SAM طریقہ کار کو وسعت دیتا ہے جس میں تصویر کو سنگل فریم ویڈیو کے طور پر دیکھا جاتا ہے، اور ریئل ٹائم ویڈیو پروسیسنگ کے لیے اسٹریمنگ میموری کے ساتھ ٹرانسفارمر آرکیٹیکچر استعمال کیا جاتا ہے۔ ریپوزٹری میں سرکاری انفرنس کوڈ، ڈاؤن لوڈ کے قابل تربیت یافتہ چیک پوائنٹس، مثال کے نوٹ بک، ٹریننگ/فائن ٹیوننگ کوڈ، اور مقامی طور پر تعینات ہونے والا ویب ڈیمو فراہم کیا گیا ہے۔ README میں بیان کردہ اہم صلاحیتیں: - تصویر کی پیشن گوئی: SAM2ImagePredictor کلاس سٹیٹک امیجز پر پرامپٹ پر مبنی سیگمنٹیشن کے لیے SAM جیسا انٹرفیس پیش کرتی ہے، بشمول خودکار ماسک جنریشن۔ - ویڈیو پیشن گوئی: ویڈیو پریڈیکٹر پوائنٹ یا باکس پرامپٹ شامل کرنے، انہیں بہتر بنانے، اور پورے ویڈیو میں ماسک لیٹس کو پھیلانے کی حمایت کرتا ہے، جس میں ملٹی آبجیکٹ ٹریکنگ اور فی آبجیکٹ انفرنس سٹیٹ شامل ہے۔ - ماڈل چیک پوائنٹس: SAM 2.1 چیک پوائنٹس (tiny, small, base_plus, large) ستمبر 2024 میں جاری ہوئے، نیز جولائی 2024 کے پہلے SAM 2 چیک پوائنٹس، جن میں سائز، رفتار اور SA-V, MOSE اور LVOS v2 پر بینچ مارک اعداد و شمار شامل ہیں۔ - ہگنگ فیس لوڈنگ: ماڈلز کو تصویر اور ویڈیو دونوں پریڈیکٹرز کے لیے from_pretrained کے ذریعے لوڈ کیا جا سکتا ہے۔ - ٹریننگ اور فائن ٹیوننگ: کسٹم امیج، ویڈیو، یا مخلوط ڈیٹاسیٹس پر ٹریننگ یا فائن ٹیوننگ کے لیے کوڈ فراہم کیا گیا ہے۔ - ویب ڈیمو: مقامی تعیناتی کے لیے فرنٹ اینڈ اور بیک اینڈ کوڈ، جو میزبان SAM 2 ڈیمو سے ملتا جلتا ہے۔ - SA-V ڈیٹاسیٹ: آج تک کا سب سے بڑا ویڈیو سیگمنٹیشن ڈیٹاسیٹ، جسے ماڈل-ان-دی-لوپ ڈیٹا انجن کے ساتھ بنایا گیا ہے؛ ڈیٹاسیٹ دستاویزات شامل ہیں۔ تنصیب کے لیے Python 3.10+، PyTorch 2.5.1+ اور TorchVision 0.20.1+ درکار ہے، کسٹم کرنل مرتب کرنے کے لیے CUDA ٹول کٹ کے ساتھ؛ ونڈوز صارفین کو WSL استعمال کرنے کا مشورہ دیا جاتا ہے۔ اختیاری ایکسٹراز نوٹ بک کے لیے Jupyter اور matplotlib انسٹال کرتے ہیں۔ README نوٹ کرتا ہے کہ CUDA ایکسٹینشن کی ناکام تعمیر کو نظر انداز کیا جا سکتا ہے، جس کا صرف محدود پوسٹ پروسیسنگ اثر ہوتا ہے۔ دسمبر 2024 کی اپ ڈیٹ نے ویڈیو آبجیکٹ سیگمنٹیشن میں رفتار کے لیے مکمل ماڈل کمپائلیشن اور اپڈیٹڈ SAM2VideoPredictor شامل کیا جو فی آبجیکٹ آزادانہ انفرنس کی حمایت کرتا ہے اور ٹریکنگ شروع ہونے کے بعد نئی آبجیکٹس شامل کرنے کی اجازت دیتا ہے۔ لائسنسنگ: ماڈل چیک پوائنٹس، ڈیمو کوڈ اور ٹریننگ کوڈ Apache 2.0 کے تحت ہیں، جبکہ Inter Font اور Noto Color Emoji SIL Open Font License 1.1 کے تحت ہیں۔ تیسرے فریق کا GPU کنیکٹڈ کمپوننٹ کوڈ cc_torch سے اخذ کیا گیا ہے جس کی اپنی لائسنس فائل ہے۔