Sobre el proyecto
CLIP (Preentrenamiento Contrastivo de Lenguaje-Imagen) es un modelo de red neuronal desarrollado por OpenAI, entrenado en un conjunto diverso de pares (imagen, texto). Puede predecir el fragmento de texto más relevante para una imagen dada usando instrucciones en lenguaje natural, sin optimización específica de la tarea, similar a las capacidades de cero disparos de GPT-2 y GPT-3. El modelo logra un rendimiento comparable al ResNet50 original en ImageNet 'cero disparos' sin usar ninguna de las 1.28M muestras etiquetadas originales.
El repositorio proporciona la implementación oficial, incluyendo funciones de carga de modelos, tokenización y codificación de características. Soporta múltiples modelos preentrenados (por ejemplo, ViT-B/32) y ofrece ejemplos para predicción de cero disparos y evaluación de sonda lineal. El código está diseñado para usarse con PyTorch y torchvision, y puede ejecutarse en GPU CUDA o CPU.
Los métodos clave de la API incluyen `clip.available_models()`, `clip.load()` y `clip.tokenize()`. El modelo cargado soporta `encode_image()`, `encode_text()` y un método forward que devuelve puntuaciones logit basadas en similitud de coseno entre características de imagen y texto.
El README incluye instrucciones de instalación, ejemplos de uso y enlaces a proyectos relacionados como OpenCLIP y la implementación de Hugging Face.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.