À propos du projet

ImageBind est l’implémentation PyTorch par FAIR Meta AI d’un modèle d’embedding multimodal. Il apprend une représentation conjointe pour six modalités : images, texte, audio, profondeur, imagerie thermique et données IMU. Une fois encodés dans l’espace partagé, les embeddings de différentes modalités peuvent être comparés, ce qui permet la recherche intermodale et l’analyse de similarité. Les travaux de recherche associés décrivent également des usages émergents tels que la combinaison de modalités par arithmétique, la détection intermodale, la génération et la classification zero-shot. Le dépôt inclut le checkpoint pré-entraîné imagebind_huge, le code du modèle, des utilitaires de chargement et de transformation des données, ainsi qu’un exemple qui extrait des embeddings d’image, de texte et d’audio et les compare à l’aide de multiplications matricielles et de scores softmax. Il rapporte des résultats zero-shot sur les benchmarks ImageNet-1K, Kinetics-400, NYU Depth, ESC, LLVIP et Ego4D. L’installation nécessite PyTorch 2.0 ou une version plus récente, et Python 3.10 est utilisé dans l’exemple Conda fourni. Les utilisateurs de Windows peuvent en outre avoir besoin de soundfile pour les entrées/sorties audio. Le code et les poids du modèle sont publiés sous la licence CC-BY-NC 4.0, qui restreint l’usage commercial. Ces travaux ont été présentés à CVPR 2023 en tant que papier mis en avant.