Sobre el proyecto

ImageBind es la implementación en PyTorch de FAIR Meta AI de un modelo de embedding multimodal. Aprende una representación conjunta para seis modalidades: imágenes, texto, audio, profundidad, imágenes térmicas y datos IMU. Una vez codificados en el espacio compartido, los embeddings de diferentes modalidades pueden compararse, lo que permite la recuperación y el análisis de similitud entre modalidades. La investigación asociada también describe usos emergentes como la combinación de modalidades mediante aritmética, detección entre modalidades, generación y clasificación zero-shot. El repositorio incluye el checkpoint preentrenado imagebind_huge, código del modelo, utilidades de carga y transformación de datos, y un ejemplo que extrae embeddings de imagen, texto y audio y los compara usando multiplicación de matrices y puntuaciones softmax. Reporta resultados zero-shot en los benchmarks ImageNet-1K, Kinetics-400, NYU Depth, ESC, LLVIP y Ego4D. La instalación requiere PyTorch 2.0 o superior y se usa Python 3.10 en el ejemplo de Conda proporcionado. Los usuarios de Windows pueden necesitar además soundfile para E/S de audio. El código y los pesos del modelo se publican bajo la licencia CC-BY-NC 4.0, que restringe el uso comercial. El trabajo se presentó en CVPR 2023 como artículo destacado.