প্রকল্প সম্পর্কে

ImageBind হলো FAIR Meta AI-এর একটি মাল্টিমোডাল এমবেডিং মডেলের PyTorch বাস্তবায়ন। এটি ছয়টি মোডালিটির জন্য একটি যৌথ রিপ্রেজেন্টেশন শেখে: ছবি, টেক্সট, অডিও, ডেপথ, থার্মাল ইমেজারি এবং IMU ডেটা। একবার শেয়ার্ড স্পেসে এনকোড করা হলে, বিভিন্ন মোডালিটির এমবেডিং তুলনা করা যায়, যা ক্রস-মোডাল রিট্রিভাল এবং সাদৃশ্য বিশ্লেষণ সক্ষম করে। সংশ্লিষ্ট গবেষণায় অ্যারিথমেটিকের মাধ্যমে মোডালিটি একত্রিত করা, ক্রস-মোডাল ডিটেকশন, জেনারেশন এবং জিরো-শট ক্লাসিফিকেশনের মতো উদ্ভূত ব্যবহারের বর্ণনাও দেওয়া হয়েছে। রিপোজিটরিতে imagebind_huge প্রি-ট্রেইনড চেকপয়েন্ট, মডেল কোড, ডেটা-লোডিং এবং ট্রান্সফরমেশন ইউটিলিটি, এবং একটি উদাহরণ রয়েছে যা ছবি, টেক্সট এবং অডিও এমবেডিং এক্সট্র্যাক্ট করে এবং ম্যাট্রিক্স মাল্টিপ্লিকেশন ও সফটম্যাক্স স্কোর ব্যবহার করে সেগুলো তুলনা করে। এটি ImageNet-1K, Kinetics-400, NYU Depth, ESC, LLVIP এবং Ego4D বেঞ্চমার্কে জিরো-শট ফলাফল রিপোর্ট করে। ইনস্টলেশনের জন্য PyTorch 2.0 বা নতুনতর প্রয়োজন এবং প্রদত্ত Conda উদাহরণে Python 3.10 ব্যবহৃত হয়। Windows ব্যবহারকারীদের অতিরিক্তভাবে অডিও I/O-এর জন্য soundfile প্রয়োজন হতে পারে। কোড এবং মডেল ওয়েট CC-BY-NC 4.0 লাইসেন্সের অধীনে প্রকাশিত, যা বাণিজ্যিক ব্যবহার সীমাবদ্ধ করে। কাজটি CVPR 2023-এ একটি হাইলাইটেড পেপার হিসেবে উপস্থাপিত হয়েছিল।