프로젝트 소개

CLIP(대조 언어-이미지 사전 훈련)은 OpenAI가 개발한 신경망 모델로, 다양한 (이미지, 텍스트) 쌍으로 훈련되었습니다. 이 모델은 작업별 최적화 없이 자연어 지침을 사용하여 주어진 이미지에 가장 관련성 높은 텍스트 조각을 예측할 수 있으며, 이는 GPT-2 및 GPT-3의 제로샷 기능과 유사합니다. 이 모델은 원래 128만 개의 레이블된 예제를 사용하지 않고 ImageNet '제로샷'에서 원래 ResNet50과 비슷한 성능을 달성합니다. 저장소는 모델 로딩, 토큰화, 특징 인코딩 함수를 포함한 공식 구현을 제공합니다. 여러 사전 훈련된 모델(예: ViT-B/32)을 지원하며 제로샷 예측 및 선형 프로브 평가 예제를 제공합니다. 코드는 PyTorch 및 torchvision과 함께 사용하도록 설계되었으며 CUDA GPU 또는 CPU에서 실행할 수 있습니다. 주요 API 메서드로는 `clip.available_models()`, `clip.load()`, `clip.tokenize()`가 있습니다. 로드된 모델은 `encode_image()`, `encode_text()`, 그리고 이미지와 텍스트 특징 간의 코사인 유사성을 기반으로 로짓 점수를 반환하는 forward 메서드를 지원합니다. README에는 설치 지침, 사용 예제, 그리고 OpenCLIP 및 Hugging Face 구현과 같은 관련 프로젝트 링크가 포함되어 있습니다.