عن المشروع

ImageBind هو تنفيذ PyTorch من FAIR Meta AI لنموذج تضمين متعدد الوسائط. يتعلم تمثيلًا مشتركًا لست وسائط: الصور، النص، الصوت، بيانات العمق، التصوير الحراري، وبيانات IMU. بمجرد ترميزها في الفضاء المشترك، يمكن مقارنة التضمينات من وسائط مختلفة، مما يتيح الاسترجاع عبر الوسائط وتحليل التشابه. يصف البحث المصاحب أيضًا استخدامات ناشئة مثل دمج الوسائط عبر العمليات الحسابية، والكشف عبر الوسائط، والتوليد، والتصنيف بدون عينات. تتضمن المستودع نقطة التحقق المدربة مسبقًا imagebind_huge، ورمز النموذج، وأدوات تحميل البيانات وتحويلها، ومثالًا يستخرج تضمينات الصور والنص والصوت ويقارنها باستخدام ضرب المصفوفات ودرجات softmax. يقدم نتائج بدون عينات على معايير ImageNet-1K وKinetics-400 وNYU Depth وESC وLLVIP وEgo4D. يتطلب التثبيت PyTorch 2.0 أو أحدث، ويُستخدم Python 3.10 في مثال Conda المقدم. قد يحتاج مستخدمو Windows أيضًا إلى soundfile لإدخال/إخراج الصوت. يتم إصدار رمز النموذج وأوزانه بموجب ترخيص CC-BY-NC 4.0، الذي يقيد الاستخدام التجاري. تم تقديم العمل في CVPR 2023 كورقة بحثية بارزة.