このプロジェクトについて
CLIP(Contrastive Language-Image Pre-Training)は、OpenAIによって開発されたニューラルネットワークモデルであり、多様な(画像、テキスト)ペアで学習されています。このモデルは、タスク固有の最適化を必要とせず、自然言語の指示を用いて、与えられた画像に対して最も関連性の高いテキスト断片を予測できます。これは、GPT-2やGPT-3のゼロショット能力と同様です。このモデルは、ImageNetの「ゼロショット」において、元の128万件のラベル付きサンプルを一切使用せずに、元のResNet50に匹敵する性能を達成します。
このリポジトリは、モデルの読み込み、トークン化、特徴エンコーディング機能を含む公式実装を提供します。複数の事前学習済みモデル(例:ViT-B/32)をサポートし、ゼロショット予測や線形プローブ評価の例を提供します。このコードはPyTorchとtorchvisionで使用するように設計されており、CUDA GPUまたはCPUで実行できます。
主要なAPIメソッドには、`clip.available_models()`、`clip.load()`、`clip.tokenize()`が含まれます。読み込まれたモデルは、`encode_image()`、`encode_text()`、および画像とテキストの特徴間のコサイン類似度に基づいてロジットスコアを返すフォワードメソッドをサポートしています。
READMEには、インストール手順、使用例、およびOpenCLIPやHugging Faceの実装などの関連プロジェクトへのリンクが含まれています。
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.