منصوبے کے بارے میں
پائٹورچ امیج ماڈلز (timm) امیج ماڈلز، لیئرز، یوٹیلیٹیز، آپٹیمائزرز، شیڈولرز، ڈیٹا لوڈرز اور آگمینٹیشنز کا ایک مجموعہ ہے، نیز اس میں ریفرنس ٹریننگ، ویلیڈیشن اور انفرنس اسکرپٹس بھی شامل ہیں۔ اس کا بیان کردہ مقصد امیج کلاسیفکیشن اور بیک بون آرکیٹیکچرز کی ایک وسیع اقسام کو جمع کرنا ہے تاکہ ImageNet ٹریننگ کے نتائج کو دوبارہ پیدا کیا جا سکے۔
یہ پروجیکٹ متعدد آرکیٹیکچر فیملیز کو یکجا کرتا ہے، جن میں ResNet، ResNeXT، EfficientNet، NFNet، Vision Transformer (ViT)، MobileNetV4، MobileNet-V3/V2، RegNet، DPN، CSPNet، Swin Transformer، MaxViT، CoAtNet اور ConvNeXt شامل ہیں۔ اس میں EVA، DINOv3، SigLIP-2، MobileCLIP-2، MetaCLIP-2، Perception Encoder، NaFlexViT اور مختلف ایفیشینٹ موبائل ماڈلز جیسی نئی اضافوں کا احاطہ بھی کیا گیا ہے۔ ماڈل کی تعریفات Hugging Face Hub پر میزبان پری ٹرینڈ ویٹس کے ساتھ جوڑ دی گئی ہیں، اور ریپوزٹری نوٹ کرتی ہے کہ کچھ ویریئنٹس جان بوجھ کر بغیر ویٹس کے شپ ہوتے ہیں۔
ماڈل کی تعریفات کے علاوہ، timm ٹریننگ اور ویلیڈیشن اسکرپٹس، انفرنس اور ایکسپورٹ یوٹیلیٹیز، اور NaFlex پائپ لائن کے ذریعے ویری ایبل ریزولیوشن اور ویری ایبل اسپیکٹ ٹریننگ کے لیے سپورٹ فراہم کرتا ہے۔ اس میں AdamW ویریئنٹس، Muon، AdaMuon، NAdaMuon، Kron اور دیگر آپٹیمائزرز شامل ہیں، نیز شیڈولرز اور آگمینٹیشن یوٹیلیٹز بھی موجود ہیں۔ حالیہ ریلیزز میں میٹا ڈیوائس انیشیلائزیشن، ڈیوائس/ڈی ٹائپ فیکٹری سپورٹ، گریڈینٹ چیک پوائنٹنگ، ONNX ایکسپورٹ میں بہتری اور محفوظ چیک پوائنٹ لوڈنگ ڈیفالٹس پر زور دیا گیا ہے۔
README دستاویزات میں بار بار ہونے والی ریلیزز، مختلف GPUs پر انفرنس ٹائمنگ کے لیے بینچ مارک رزلٹ فائلیں، اور پیپرز اور سورس ریپوزٹریز کے لنکس کے ساتھ تعاون شدہ ماڈلز کی ایک طویل فہرست شامل ہے۔ اس میں بہت سے بیرونی مصنفین اور پروجیکٹس کے تعاون کا اعتراف بھی کیا گیا ہے۔
یہ PyTorch ویژن ماڈلز کے ساتھ کام کرنے والے ڈویلپرز اور ریسرچرز کے لیے ایک لائبریری اور ٹول چین ہے، نہ کہ ایک اینڈ یوزر ایپلیکیشن۔ یہ امیج انکوڈرز اور بیک بونز کو ٹرین، فائن ٹیون، ایویلیوٹ، ایکسپورٹ اور بینچ مارک کرنے کے لیے مفید ہے۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.