Sobre el proyecto

OpenCLIP es una implementación de código abierto del CLIP de OpenAI (Preentrenamiento Contrastivo de Lenguaje e Imágenes). Proporciona una biblioteca de Python, open_clip_torch, para cargar modelos preentrenados de imagen-texto, calcular embeddings y ejecutar clasificación zero-shot, así como un stack de entrenamiento para reproducir y extender modelos estilo CLIP. Capacidades clave: - Zoológico de modelos preentrenados: modelos entrenados en LAION-400M, LAION-2B, DataComp-1B y otros, además de soporte para cargar pesos de OpenAI CLIP, SigLIP, DFN, SigLIP2 y PE. Los modelos se pueden listar mediante open_clip.list_pretrained() y cargarse con create_model_and_transforms, incluso desde rutas locales o Hugging Face Hub. - API de inferencia: codifica imágenes y texto en un espacio de embeddings compartido, y luego calcula probabilidades de etiquetas basadas en similitud para clasificación zero-shot. Se muestra un ejemplo de uso con ViT-B-32 y pesos laion2b_s34b_b79k. - Stack de entrenamiento: la rama principal utiliza un pipeline de entrenamiento refactorizado construido alrededor de envoltorios TrainingTask, lotes basados en diccionarios, soporte FSDP2, pipelines de imagen/audio de resolución variable NaFlex y múltiples estrategias de torch.compile. Una rama v3 conserva la API de entrenamiento estable de versiones anteriores. - Familias de modelos: CLIP, SigLIP, CoCa, MaMMUT, CLAP de audio-texto, NaFlex CLIP/CLAP, subtitulado generativo GenLIP/GenLAP y torres de texto modernas con RoPE, SwiGLU, RMSNorm y pooling enmascarado. - Herramientas: envoltorios de tokenizador, fábrica de pérdidas (create_loss), pipelines WebDataset, agrupación por longitud, soporte de acumulación de gradientes e integración con el tokenizador de Hugging Face. Detalles operativos notables del README: torch mínimo >=2.6, las cargas de checkpoints usan weights_only=True, y varios cambios de API/CLI que rompen compatibilidad están documentados para la rama principal. Los checkpoints preentrenados .pt existentes siguen siendo cargables. El proyecto también señala clip-retrieval para cálculo de embeddings a gran escala y WiSE-FT para ajuste fino de modelos zero-shot en tareas de clasificación.