عن المشروع

OpenCLIP هو تنفيذ مفتوح المصدر لـ CLIP (التدريب التبايني على اللغة والصور) من OpenAI. يوفر مكتبة Python، open_clip_torch، لتحميل نماذج الصور والنصوص المدربة مسبقًا، وحساب التضمينات، وتشغيل التصنيف الصفري، بالإضافة إلى حزمة تدريب لإعادة إنتاج نماذج بنمط CLIP وتوسيعها. القدرات الرئيسية: - حديقة النماذج المدربة مسبقًا: نماذج مدربة على LAION-400M وLAION-2B وDataComp-1B وغيرها، بالإضافة إلى دعم تحميل أوزان OpenAI CLIP وSigLIP وDFN وSigLIP2 وPE. يمكن سرد النماذج عبر open_clip.list_pretrained() وتحميلها باستخدام create_model_and_transforms، بما في ذلك من مسارات محلية أو Hugging Face Hub. - واجهة الاستدلال: ترميز الصور والنصوص إلى فضاء تضمين مشترك، ثم حساب احتمالات التسميات القائمة على التشابه للتصنيف الصفري. يظهر مثال الاستخدام مع أوزان ViT-B-32 وlaion2b_s34b_b79k. - حزمة التدريب: يستخدم الفرع الرئيسي خط أنابيب تدريب معاد هيكلته مبنيًا حول أغلفة TrainingTask، ودفعات قائمة على dict، ودعم FSDP2، وخطوط أنابيب صور/صوت متغيرة الدقة NaFlex، واستراتيجيات متعددة لـ torch.compile. يحافظ فرع v3 على واجهة التدريب الأقدم المستقرة للإصدار. - عائلات النماذج: CLIP وSigLIP وCoCa وMaMMUT وCLAP للصوت والنص وNaFlex CLIP/CLAP وGenLIP/GenLAP للتسمية التوليدية، وأبراج نصية حديثة مع RoPE وSwiGLU وRMSNorm والتجميع المقنّع. - الأدوات: أغلفة tokenizer، ومصنع الخسارة (create_loss)، وخطوط أنابيب WebDataset، وتجميع الطول في حزم، ودعم تراكم التدرجات، وتكامل tokenizer من Hugging Face. تفاصيل تشغيلية بارزة من README: الحد الأدنى torch>=2.6، وتحميل نقاط التفتيش يستخدم weights_only=True، وهناك عدة تغييرات كاسرة في API/CLI موثقة للفرع الرئيسي. تبقى نقاط التفتيش .pt المدربة مسبقًا قابلة للتحميل. يشير المشروع أيضًا إلى clip-retrieval لحساب التضمينات على نطاق واسع وWiSE-FT لضبط النماذج الصفرية على مهام التصنيف.