Об этом проекте
CLIP (Contrastive Language-Image Pre-Training) — это нейросетевая модель, разработанная OpenAI и обученная на разнообразном наборе пар (изображение, текст). Она может предсказывать наиболее релевантный текстовый фрагмент для заданного изображения с помощью инструкций на естественном языке, без оптимизации под конкретную задачу, аналогично zero-shot возможностям GPT-2 и GPT-3. Модель достигает производительности, сопоставимой с оригинальным ResNet50 на ImageNet в режиме «zero-shot», не используя ни одного из исходных 1,28 млн размеченных примеров.
Репозиторий содержит официальную реализацию, включая функции загрузки модели, токенизации и кодирования признаков. Он поддерживает несколько предобученных моделей (например, ViT-B/32) и предлагает примеры для zero-shot предсказания и оценки методом линейного зонда. Код рассчитан на использование с PyTorch и torchvision и может работать на CUDA-графических процессорах или CPU.
Ключевые методы API включают `clip.available_models()`, `clip.load()` и `clip.tokenize()`. Загруженная модель поддерживает `encode_image()`, `encode_text()` и метод прямого прохода, возвращающий логит-оценки на основе косинусного сходства между признаками изображения и текста.
README содержит инструкции по установке, примеры использования и ссылки на связанные проекты, такие как OpenCLIP и реализация от Hugging Face.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.