このプロジェクトについて
ImageBindは、FAIR Meta AIの多モーダル埋め込みモデルであるPyTorch実装です。画像、テキスト、オーディオ、深度、熱画像、IMUデータの6つのモダリティの共同表現を学習します。共有空間にエンコードされた後、異なるモダリティの埋め込みを比較して、クロスモーダル検索や類似性分析を可能にします。付随する研究では、モダリティの結合、クロスモーダル検出、生成、ゼロショット分類などの新しい用途についても説明しています。
リポジトリには、imagebind_hugeの事前トレーニング済みチェックポイント、モデルコード、データロードおよび変換ユーティリティ、および画像、テキスト、オーディオの埋め込みを抽出し、行列乗算とソフトマックススコアを使用して比較する例が含まれています。ImageNet-1K、Kinetics-400、NYU Depth、ESC、LLVIP、Ego4Dベンチマークでのゼロショット結果を報告しています。
インストールにはPyTorch 2.0以上とPython 3.10が必要です。提供されたCondaの例ではPython 3.10が使用されています。Windowsユーザーは、オーディオ入出力にsoundfileが必要になる場合があります。コードとモデル重みは、商用利用を制限するCC-BY-NC 4.0ライセンスの下でリリースされています。この研究は、CVPR 2023でハイライトペーパーとして発表されました。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.