عن المشروع
PyTorch Image Models (timm) هي مجموعة من نماذج الصور والطبقات والأدوات المساعدة والمحسنات والجداولة ومحمّلات البيانات ووظائف تحسين البيانات، بالإضافة إلى نصوص مرجعية للتدريب والتحقق والاستدلال. هدفها المعلن هو جمع مجموعة واسعة من بنى تصنيف الصور والبنى الأساسية (backbones) مع القدرة على إعادة إنتاج نتائج تدريب ImageNet.
يجمع المشروع العديد من عائلات البنى، بما في ذلك ResNet وResNeXT وEfficientNet وNFNet وVision Transformer (ViT) وMobileNetV4 وMobileNet-V3/V2 وRegNet وDPN وCSPNet وSwin Transformer وMaxViT وCoAtNet وConvNeXt. كما يغطي إضافات أحدث مثل EVA وDINOv3 وSigLIP-2 وMobileCLIP-2 وMetaCLIP-2 وPerception Encoder وNaFlexViT، والعديد من النماذج الفعالة الموجهة للهواتف المحمولة. تُرفق تعريفات النماذج بأوزان مدربة مسبقًا مستضافة على Hugging Face Hub، وتشير المستودعات إلى أن بعض المتغيرات تُطرح عمدًا بدون أوزان.
إلى جانب تعريفات النماذج، توفر timm نصوصًا للتدريب والتحقق، وأدوات للاستدلال والتصدير، ودعمًا للتدريب بدقة متغيرة ونسبة أبعاد متغيرة عبر خط أنابيب NaFlex. تتضمن محسنات مثل متغيرات AdamW وMuon وAdaMuon وNAdaMuon وKron وغيرها، إلى جانب الجداولة وأدوات تحسين البيانات. تؤكد الإصدارات الأخيرة على تهيئة الأجهزة الوصفية (meta-device)، ودعم مصانع الأجهزة/الأنواع، وتدقيق التدرجات (gradient checkpointing)، وتحسينات تصدير ONNX، وإعدادات افتراضية أكثر أمانًا لتحميل نقاط التحقق.
يوثق ملف README الإصدارات المتكررة، وملفات نتائج القياس لتوقيت الاستدلال على وحدات معالجة رسومية مختلفة، وقائمة طويلة من النماذج المساهَم بها مع روابط للأوراق البحثية والمستودعات المصدرية. كما يعترف بمساهمات العديد من المؤلفين والمشاريع الخارجية.
هذه مكتبة وأدوات للمطورين والباحثين الذين يعملون مع نماذج الرؤية في PyTorch، وليست تطبيقًا للمستخدم النهائي. إنها مفيدة لتدريب وضبط دقيق وتقييم وتصدير وقياس أداء مشفرات الصور والبنى الأساسية.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.