منصوبے کے بارے میں

ImageBind، FAIR Meta AI کا ایک ملٹی موڈل ایمبیڈنگ ماڈل کا PyTorch نفاذ ہے۔ یہ چھ موڈلٹیز کے لیے مشترکہ نمائندگی سیکھتا ہے: تصاویر، متن، آڈیو، گہرائی، تھرمل امیجری اور IMU ڈیٹا۔ مشترکہ اسپیس میں انکوڈ ہونے کے بعد، مختلف موڈلٹیز کے ایمبیڈنگز کا موازنہ کیا جا سکتا ہے، جس سے کراس موڈل بازیافت اور مماثلت کا تجزیہ ممکن ہوتا ہے۔ ساتھ ہی تحقیقی مقالہ ابھرتے ہوئے استعمالات بھی بیان کرتا ہے جیسے ریاضی کے ذریعے موڈلٹیز کو یکجا کرنا، کراس موڈل detection، generation اور zero-shot classification۔ ریپوزٹری میں imagebind_huge پہلے سے تربیت یافتہ چیک پوائنٹ، ماڈل کوڈ، ڈیٹا لوڈنگ اور ٹرانسفارمیشن یوٹیلیٹیز، اور ایک مثال شامل ہے جو تصویر، متن اور آڈیو ایمبیڈنگز نکال کر میٹرکس ضرب اور softmax اسکورز کے ذریعے ان کا موازنہ کرتی ہے۔ یہ ImageNet-1K، Kinetics-400، NYU Depth، ESC، LLVIP اور Ego4D بینچ مارکس پر zero-shot نتائج رپورٹ کرتا ہے۔ تنصیب کے لیے PyTorch 2.0 یا نیا ورژن درکار ہے اور فراہم کردہ Conda مثال میں Python 3.10 استعمال کیا گیا ہے۔ Windows صارفین کو آڈیو I/O کے لیے اضافی طور پر soundfile کی ضرورت پڑ سکتی ہے۔ کوڈ اور ماڈل وزن CC-BY-NC 4.0 لائسنس کے تحت جاری کیے گئے ہیں، جو تجارتی استعمال کو محدود کرتا ہے۔ یہ کام CVPR 2023 میں بطور highlighted paper پیش کیا گیا تھا۔