इस प्रोजेक्ट के बारे में

CLIP (Contrastive Language-Image Pre-Training) एक न्यूरल नेटवर्क मॉडल है जिसे OpenAI द्वारा विकसित किया गया है, और इसे विविध (image, text) जोड़ों के सेट पर प्रशिक्षित किया गया है। यह किसी दी गई इमेज के लिए सबसे प्रासंगिक टेक्स्ट स्निपेट का पूर्वानुमान प्राकृतिक भाषा निर्देशों का उपयोग करके लगा सकता है, बिना किसी कार्य-विशिष्ट अनुकूलन के, जो GPT-2 और GPT-3 की जीरो-शॉट क्षमताओं के समान है। यह मॉडल ImageNet 'zero-shot' पर मूल ResNet50 के तुलनीय प्रदर्शन प्राप्त करता है, बिना मूल 1.28M लेबल किए गए उदाहरणों में से किसी का उपयोग किए। यह रिपॉजिटरी आधिकारिक कार्यान्वयन प्रदान करती है, जिसमें मॉडल लोडिंग, टोकनाइजेशन, और फीचर एन्कोडिंग फंक्शन शामिल हैं। यह कई पूर्व-प्रशिक्षित मॉडलों (जैसे, ViT-B/32) का समर्थन करती है और जीरो-शॉट पूर्वानुमान तथा लीनियर-प्रोब मूल्यांकन के उदाहरण प्रदान करती है। कोड को PyTorch और torchvision के साथ उपयोग के लिए डिज़ाइन किया गया है, और यह CUDA GPUs या CPU पर चल सकता है। मुख्य API विधियों में `clip.available_models()`, `clip.load()`, और `clip.tokenize()` शामिल हैं। लोड किया गया मॉडल `encode_image()`, `encode_text()`, और एक फॉरवर्ड विधि का समर्थन करता है जो इमेज और टेक्स्ट फीचर्स के बीच कोसाइन समानता के आधार पर लॉजिट स्कोर लौटाती है। README में इंस्टॉलेशन निर्देश, उपयोग के उदाहरण, और संबंधित परियोजनाओं जैसे OpenCLIP और Hugging Face के कार्यान्वयन के लिंक शामिल हैं।