このプロジェクトについて
OpenCLIPは、OpenAIのCLIP(コントラスト言語画像事前学習)のオープンソース実装です。Pythonライブラリであるopen_clip_torchを提供し、事前学習済みの画像テキストモデルの読み込み、埋め込みの計算、ゼロショット分類の実行が可能です。また、CLIPスタイルのモデルを再現・拡張するための学習スタックも含まれています。
主な機能:
- 事前学習モデル群:LAION-400M、LAION-2B、DataComp-1Bなどで学習されたモデルに加え、OpenAI CLIP、SigLIP、DFN、SigLIP2、PEの重みの読み込みもサポート。モデルはopen_clip.list_pretrained()で一覧表示でき、create_model_and_transformsでローカルパスやHugging Face Hubから読み込めます。
- 推論API:画像とテキストを共有埋め込み空間にエンコードし、類似度ベースのラベル確率を計算してゼロショット分類を行います。ViT-B-32とlaion2b_s34b_b79kの重みを使用した使用例が示されています。
- 学習スタック:メインブランチでは、TrainingTaskラッパー、辞書ベースのバッチ、FSDP2サポート、NaFlex可変解像度画像/音声パイプライン、複数のtorch.compile戦略を中心にリファクタリングされた学習パイプラインを使用。v3ブランチでは、以前のリリース安定版の学習APIが維持されています。
- モデルファミリー:CLIP、SigLIP、CoCa、MaMMUT、CLAP音声テキスト、NaFlex CLIP/CLAP、GenLIP/GenLAP生成キャプション、RoPE、SwiGLU、RMSNorm、マスクプーリングを備えた最新のテキストタワー。
- ツール:トークナイザーラッパー、損失ファクトリ(create_loss)、WebDatasetパイプライン、長さバケット化、勾配累積サポート、Hugging Faceトークナイザー統合。
READMEの注目すべき運用詳細:最小torch>=2.6、チェックポイント読み込みはweights_only=Trueを使用、メインブランチのいくつかの破壊的なAPI/CLI変更が文書化されています。既存の事前学習済み.ptチェックポイントは引き続き読み込み可能です。プロジェクトはまた、大規模埋め込み計算用のclip-retrievalと、分類タスクでのゼロショットモデルのファインチューニング用のWiSE-FTも紹介しています。
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.