इस प्रोजेक्ट के बारे में
CLIP (Contrastive Language-Image Pre-Training) एक न्यूरल नेटवर्क मॉडल है जिसे OpenAI द्वारा विकसित किया गया है, और इसे विविध (image, text) जोड़ों के सेट पर प्रशिक्षित किया गया है। यह किसी दी गई इमेज के लिए सबसे प्रासंगिक टेक्स्ट स्निपेट का पूर्वानुमान प्राकृतिक भाषा निर्देशों का उपयोग करके लगा सकता है, बिना किसी कार्य-विशिष्ट अनुकूलन के, जो GPT-2 और GPT-3 की जीरो-शॉट क्षमताओं के समान है। यह मॉडल ImageNet 'zero-shot' पर मूल ResNet50 के तुलनीय प्रदर्शन प्राप्त करता है, बिना मूल 1.28M लेबल किए गए उदाहरणों में से किसी का उपयोग किए।
यह रिपॉजिटरी आधिकारिक कार्यान्वयन प्रदान करती है, जिसमें मॉडल लोडिंग, टोकनाइजेशन, और फीचर एन्कोडिंग फंक्शन शामिल हैं। यह कई पूर्व-प्रशिक्षित मॉडलों (जैसे, ViT-B/32) का समर्थन करती है और जीरो-शॉट पूर्वानुमान तथा लीनियर-प्रोब मूल्यांकन के उदाहरण प्रदान करती है। कोड को PyTorch और torchvision के साथ उपयोग के लिए डिज़ाइन किया गया है, और यह CUDA GPUs या CPU पर चल सकता है।
मुख्य API विधियों में `clip.available_models()`, `clip.load()`, और `clip.tokenize()` शामिल हैं। लोड किया गया मॉडल `encode_image()`, `encode_text()`, और एक फॉरवर्ड विधि का समर्थन करता है जो इमेज और टेक्स्ट फीचर्स के बीच कोसाइन समानता के आधार पर लॉजिट स्कोर लौटाती है।
README में इंस्टॉलेशन निर्देश, उपयोग के उदाहरण, और संबंधित परियोजनाओं जैसे OpenCLIP और Hugging Face के कार्यान्वयन के लिंक शामिल हैं।
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.