عن المشروع
CLIP (التدريب المسبق التبايني للغة والصورة) هو نموذج شبكة عصبية طورته OpenAI، تم تدريبه على مجموعة متنوعة من أزواج (صورة، نص). يمكنه التنبؤ بأكثر مقتطف نصي صلة لصورة معينة باستخدام تعليمات اللغة الطبيعية، دون تحسين خاص بالمهمة، على غرار قدرات التعلم الصفري في GPT-2 وGPT-3. يحقق النموذج أداءً مماثلاً لـ ResNet50 الأصلي على ImageNet في وضع 'التعلم الصفري' دون استخدام أي من الأمثلة الموسومة الأصلية البالغ عددها 1.28 مليون.
يوفر المستودع التنفيذ الرسمي، بما في ذلك تحميل النموذج، والتقسيم إلى رموز، ووظائف ترميز الميزات. يدعم نماذج متعددة مدربة مسبقًا (مثل ViT-B/32) ويقدم أمثلة للتنبؤ الصفري وتقييم المسبار الخطي. الكود مصمم للاستخدام مع PyTorch وtorchvision، ويمكن تشغيله على وحدات معالجة الرسومات CUDA أو وحدة المعالجة المركزية.
تشمل طرق واجهة برمجة التطبيقات الرئيسية `clip.available_models()` و`clip.load()` و`clip.tokenize()`. يدعم النموذج المحمل `encode_image()` و`encode_text()` وطريقة تمرير أمامي تُرجع درجات logit بناءً على تشابه جيب التمام بين ميزات الصورة والنص.
يتضمن ملف README تعليمات التثبيت وأمثلة الاستخدام وروابط لمشاريع ذات صلة مثل OpenCLIP وتنفيذ Hugging Face.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.