Об этом проекте

ImageBind — это реализация мультимодальной модели эмбеддингов на PyTorch от FAIR Meta AI. Она изучает совместное представление для шести модальностей: изображений, текста, аудио, глубины, тепловизионных изображений и данных IMU. После кодирования в общее пространство эмбеддинги из разных модальностей можно сравнивать, что обеспечивает кросс-модальный поиск и анализ сходства. Сопутствующее исследование также описывает эмерджентные применения, такие как объединение модальностей с помощью арифметики, кросс-модальное обнаружение, генерация и zero-shot классификация. Репозиторий включает предобученный чекпойнт imagebind_huge, код модели, утилиты загрузки и преобразования данных, а также пример, который извлекает эмбеддинги изображений, текста и аудио и сравнивает их с помощью матричного умножения и оценок softmax. В нём сообщаются результаты zero-shot на бенчмарках ImageNet-1K, Kinetics-400, NYU Depth, ESC, LLVIP и Ego4D. Для установки требуется PyTorch 2.0 или новее, а в приведённом примере Conda используется Python 3.10. Пользователям Windows может дополнительно понадобиться soundfile для аудио I/O. Код и веса модели выпущены под лицензией CC-BY-NC 4.0, которая ограничивает коммерческое использование. Работа была представлена на CVPR 2023 как highlighted paper.