প্রকল্প সম্পর্কে

PyTorch Image Models (timm) হলো ইমেজ মডেল, লেয়ার, ইউটিলিটি, অপটিমাইজার, শিডিউলার, ডেটা লোডার এবং অগমেন্টেশনের একটি সংগ্রহ, সাথে রেফারেন্স প্রশিক্ষণ, ভ্যালিডেশন এবং ইনফারেন্স স্ক্রিপ্ট। এর ঘোষিত লক্ষ্য হলো বিভিন্ন ধরনের ইমেজ ক্লাসিফিকেশন এবং ব্যাকবোন আর্কিটেকচার একত্রিত করা, যা ImageNet প্রশিক্ষণের ফলাফল পুনরুৎপাদন করতে সক্ষম। প্রকল্পটি অনেক আর্কিটেকচার পরিবারকে একত্রিত করে, যার মধ্যে রয়েছে ResNet, ResNeXT, EfficientNet, NFNet, Vision Transformer (ViT), MobileNetV4, MobileNet-V3/V2, RegNet, DPN, CSPNet, Swin Transformer, MaxViT, CoAtNet এবং ConvNeXt। এটি EVA, DINOv3, SigLIP-2, MobileCLIP-2, MetaCLIP-2, Perception Encoder, NaFlexViT এবং বিভিন্ন কার্যকরী মোবাইল-ভিত্তিক মডেলের মতো নতুন সংযোজনও অন্তর্ভুক্ত করে। মডেল সংজ্ঞাগুলি Hugging Face Hub-এ হোস্ট করা প্রি-ট্রেইন্ড ওয়েটের সাথে যুক্ত, এবং রিপোজিটরিতে উল্লেখ করা হয়েছে যে কিছু ভেরিয়েন্ট ইচ্ছাকৃতভাবে ওয়েট ছাড়া পাঠানো হয়। মডেল সংজ্ঞার বাইরে, timm প্রশিক্ষণ এবং ভ্যালিডেশন স্ক্রিপ্ট, ইনফারেন্স এবং এক্সপোর্ট ইউটিলিটি এবং NaFlex পাইপলাইনের মাধ্যমে পরিবর্তনশীল-রেজোলিউশন এবং পরিবর্তনশীল-অ্যাসপেক্ট প্রশিক্ষণের সমর্থন প্রদান করে। এতে AdamW ভেরিয়েন্ট, Muon, AdaMuon, NAdaMuon, Kron এবং অন্যান্যদের মতো অপটিমাইজার, সাথে শিডিউলার এবং অগমেন্টেশন ইউটিলিটি অন্তর্ভুক্ত। সাম্প্রতিক রিলিজগুলিতে মেটা-ডিভাইস initialization, device/dtype ফ্যাক্টরি সমর্থন, গ্রেডিয়েন্ট চেকপয়েন্টিং, ONNX এক্সপোর্ট উন্নতি এবং নিরাপদ চেকপয়েন্ট লোডিং ডিফল্টের উপর জোর দেওয়া হয়েছে। README-তে ঘন ঘন রিলিজ, বিভিন্ন GPU-তে ইনফারেন্স টাইমিংয়ের জন্য বেঞ্চমার্ক ফলাফল ফাইল এবং কাগজ ও সোর্স রিপোজিটরির লিঙ্কসহ অবদানকৃত মডেলের একটি দীর্ঘ তালিকা নথিভুক্ত করা হয়েছে। এটি অনেক বাহ্যিক লেখক এবং প্রকল্পের অবদানও স্বীকার করে। এটি PyTorch ভিশন মডেল নিয়ে কাজ করা ডেভেলপার এবং গবেষকদের জন্য একটি লাইব্রেরি এবং টুলচেইন, শেষ-ব্যবহারকারী অ্যাপ্লিকেশন নয়। এটি ইমেজ এনকোডার এবং ব্যাকবোন প্রশিক্ষণ, ফাইন-টিউনিং, মূল্যায়ন, এক্সপোর্ট এবং বেঞ্চমার্ক করার জন্য উপযোগী।