À propos du projet
OpenCLIP est une implémentation open source du CLIP (Contrastive Language-Image Pre-training) d'OpenAI. Il fournit une bibliothèque Python, open_clip_torch, pour charger des modèles image-texte pré-entraînés, calculer des embeddings et exécuter une classification zéro-shot, ainsi qu'une pile d'entraînement pour reproduire et étendre les modèles de style CLIP.
Capacités clés :
- Zoo de modèles pré-entraînés : modèles entraînés sur LAION-400M, LAION-2B, DataComp-1B et autres, plus la prise en charge du chargement des poids OpenAI CLIP, SigLIP, DFN, SigLIP2 et PE. Les modèles peuvent être listés via open_clip.list_pretrained() et chargés avec create_model_and_transforms, y compris depuis des chemins locaux ou Hugging Face Hub.
- API d'inférence : encoder les images et le texte dans un espace d'embedding partagé, puis calculer des probabilités de labels basées sur la similarité pour la classification zéro-shot. Un exemple d'utilisation est montré avec ViT-B-32 et les poids laion2b_s34b_b79k.
- Pile d'entraînement : la branche principale utilise un pipeline d'entraînement refactorisé construit autour de wrappers TrainingTask, de lots basés sur des dictionnaires, du support FSDP2, de pipelines d'images/audio à résolution variable NaFlex et de plusieurs stratégies torch.compile. Une branche v3 préserve l'ancienne API d'entraînement stable de version.
- Familles de modèles : CLIP, SigLIP, CoCa, MaMMUT, CLAP audio-texte, NaFlex CLIP/CLAP, GenLIP/GenLAP pour la légendisation générative, et des tours de texte modernes avec RoPE, SwiGLU, RMSNorm et pooling masqué.
- Outillage : wrappers de tokenizer, fabrique de pertes (create_loss), pipelines WebDataset, length bucketing, support de l'accumulation de gradient et intégration du tokenizer Hugging Face.
Détails opérationnels notables du README : torch>=2.6 minimum, les chargements de checkpoints utilisent weights_only=True, et plusieurs changements cassants d'API/CLI sont documentés pour la branche principale. Les checkpoints .pt pré-entraînés existants restent chargeables. Le projet renvoie également vers clip-retrieval pour le calcul d'embeddings à grande échelle et WiSE-FT pour le fine-tuning de modèles zéro-shot sur des tâches de classification.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.