Sobre o projeto
CLIP (Contrastive Language-Image Pre-Training) é um modelo de rede neural desenvolvido pela OpenAI, treinado em um conjunto diversificado de pares (imagem, texto). Ele pode prever o trecho de texto mais relevante para uma determinada imagem usando instruções em linguagem natural, sem otimização específica para a tarefa, semelhante às capacidades zero-shot do GPT-2 e GPT-3. O modelo alcança desempenho comparável ao ResNet50 original no ImageNet 'zero-shot' sem usar nenhum dos 1,28M exemplos rotulados originais.
O repositório fornece a implementação oficial, incluindo funções de carregamento de modelo, tokenização e codificação de características. Ele suporta vários modelos pré-treinados (por exemplo, ViT-B/32) e oferece exemplos para previsão zero-shot e avaliação linear-probe. O código é projetado para uso com PyTorch e torchvision, e pode ser executado em GPUs CUDA ou CPU.
Os principais métodos da API incluem `clip.available_models()`, `clip.load()` e `clip.tokenize()`. O modelo carregado suporta `encode_image()`, `encode_text()` e um método forward que retorna pontuações de logit com base na similaridade de cosseno entre características de imagem e texto.
O README inclui instruções de instalação, exemplos de uso e links para projetos relacionados, como OpenCLIP e a implementação do Hugging Face.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.