这个项目能做什么
ImageBind 是 FAIR Meta AI 对多模态嵌入模型的 PyTorch 实现。它为六种模态学习联合表示:图像、文本、音频、深度、热成像和 IMU 数据。一旦编码到共享空间,来自不同模态的嵌入就可以进行比较,从而实现跨模态检索和相似性分析。相关研究还描述了涌现用途,例如通过算术组合模态、跨模态检测、生成和零样本分类。
该仓库包含 imagebind_huge 预训练检查点、模型代码、数据加载和转换工具,以及一个示例,该示例提取图像、文本和音频嵌入,并使用矩阵乘法和 softmax 分数进行比较。它报告了在 ImageNet-1K、Kinetics-400、NYU Depth、ESC、LLVIP 和 Ego4D 基准上的零样本结果。
安装需要 PyTorch 2.0 或更高版本,提供的 Conda 示例使用 Python 3.10。Windows 用户可能还需要 soundfile 用于音频 I/O。代码和模型权重在 CC-BY-NC 4.0 许可下发布,该许可限制商业使用。这项工作在 CVPR 2023 上作为亮点论文展示。
评论
0 评分人数达到10人后显示
登录后参与讨论。