Sobre o projeto

O ImageBind é a implementação em PyTorch do modelo de embedding multimodal da FAIR Meta AI. Ele aprende uma representação conjunta para seis modalidades: imagens, texto, áudio, profundidade, imagens térmicas e dados de IMU. Uma vez codificados no espaço compartilhado, os embeddings de diferentes modalidades podem ser comparados, permitindo recuperação e análise de similaridade entre modalidades. A pesquisa associada também descreve usos emergentes, como combinar modalidades por meio de aritmética, detecção entre modalidades, geração e classificação zero-shot. O repositório inclui o checkpoint pré-treinado imagebind_huge, código do modelo, utilitários de carregamento e transformação de dados, e um exemplo que extrai embeddings de imagem, texto e áudio e os compara usando multiplicação de matrizes e pontuações softmax. Ele relata resultados zero-shot nos benchmarks ImageNet-1K, Kinetics-400, NYU Depth, ESC, LLVIP e Ego4D. A instalação requer PyTorch 2.0 ou mais recente, e Python 3.10 é usado no exemplo de Conda fornecido. Usuários do Windows podem precisar adicionalmente do soundfile para E/S de áudio. O código e os pesos do modelo são disponibilizados sob a licença CC-BY-NC 4.0, que restringe o uso comercial. O trabalho foi apresentado na CVPR 2023 como um artigo destacado.