इस प्रोजेक्ट के बारे में

ImageBind FAIR Meta AI का एक मल्टीमॉडल एम्बेडिंग मॉडल का PyTorch कार्यान्वयन है। यह छह मोडलिटीज़ के लिए एक संयुक्त प्रतिनिधित्व सीखता है: छवियाँ, टेक्स्ट, ऑडियो, गहराई, थर्मल इमेजरी और IMU डेटा। साझा स्पेस में एन्कोड होने के बाद, विभिन्न मोडलिटीज़ के एम्बेडिंग्स की तुलना की जा सकती है, जिससे क्रॉस-मॉडल रिट्रीवल और समानता विश्लेषण संभव होता है। साथ में दिया गया शोध अंकगणित के माध्यम से मोडलिटीज़ को संयोजित करने, क्रॉस-मॉडल डिटेक्शन, जनरेशन और ज़ीरो-शॉट क्लासिफिकेशन जैसे उभरते उपयोगों का भी वर्णन करता है। रिपॉज़िटरी में imagebind_huge प्रीट्रेन्ड चेकपॉइंट, मॉडल कोड, डेटा-लोडिंग और ट्रांसफॉर्मेशन यूटिलिटीज़, और एक उदाहरण शामिल है जो छवि, टेक्स्ट और ऑडियो एम्बेडिंग्स निकालता है और उन्हें मैट्रिक्स गुणा और सॉफ्टमैक्स स्कोर का उपयोग करके तुलना करता है। यह ImageNet-1K, Kinetics-400, NYU Depth, ESC, LLVIP और Ego4D बेंचमार्क पर ज़ीरो-शॉट परिणाम रिपोर्ट करता है। इंस्टॉलेशन के लिए PyTorch 2.0 या नया संस्करण आवश्यक है और दिए गए Conda उदाहरण में Python 3.10 का उपयोग किया गया है। Windows उपयोगकर्ताओं को ऑडियो I/O के लिए अतिरिक्त रूप से soundfile की आवश्यकता हो सकती है। कोड और मॉडल वेट CC-BY-NC 4.0 लाइसेंस के तहत जारी किए गए हैं, जो व्यावसायिक उपयोग को प्रतिबंधित करता है। यह कार्य CVPR 2023 में एक हाइलाइटेड पेपर के रूप में प्रस्तुत किया गया था।