প্রকল্প সম্পর্কে
SAM 2 (Segment Anything Model 2) হলো Meta AI / FAIR-এর একটি ফাউন্ডেশন মডেল, যা ছবি এবং ভিডিও উভয় ক্ষেত্রে প্রম্পটযোগ্য ভিজ্যুয়াল সেগমেন্টেশন সক্ষম করে। এটি মূল SAM পদ্ধতিকে সম্প্রসারিত করে একটি ছবিকে একক-ফ্রেমের ভিডিও হিসেবে বিবেচনা করে এবং রিয়েল-টাইম ভিডিও প্রসেসিংয়ের জন্য স্ট্রিমিং মেমোরি সহ একটি ট্রান্সফরমার আর্কিটেকচার ব্যবহার করে। রিপোজিটরিটিতে অফিসিয়াল ইনফারেন্স কোড, ডাউনলোডযোগ্য প্রশিক্ষিত চেকপয়েন্ট, উদাহরণ নোটবুক, প্রশিক্ষণ/ফাইন-টিউনিং কোড এবং একটি লোকালি ডিপ্লয়যোগ্য ওয়েব ডেমো প্রদান করা হয়েছে।
README-তে বর্ণিত মূল ক্ষমতাসমূহ:
- ইমেজ প্রেডিকশন: SAM2ImagePredictor ক্লাসটি স্থির ছবিতে প্রম্পট-ভিত্তিক সেগমেন্টেশনের জন্য SAM-এর মতো একটি ইন্টারফেস প্রদান করে, যার মধ্যে স্বয়ংক্রিয় মাস্ক জেনারেশন অন্তর্ভুক্ত।
- ভিডিও প্রেডিকশন: একটি ভিডিও প্রেডিক্টর পয়েন্ট বা বক্স প্রম্পট যোগ করা, সেগুলো পরিমার্জন করা এবং ভিডিও জুড়ে মাস্কলেট প্রচার করা সমর্থন করে, সাথে মাল্টি-অবজেক্ট ট্র্যাকিং এবং প্রতি-অবজেক্ট ইনফারেন্স স্টেট থাকে।
- মডেল চেকপয়েন্ট: সেপ্টেম্বর ২০২৪-এ প্রকাশিত SAM 2.1 চেকপয়েন্ট (tiny, small, base_plus, large) এবং জুলাই ২০২৪-এর আগের SAM 2 চেকপয়েন্ট, সাথে SA-V, MOSE এবং LVOS v2-তে রিপোর্ট করা আকার, গতি এবং বেঞ্চমার্ক পরিসংখ্যান।
- হাগিং ফেস লোডিং: ইমেজ এবং ভিডিও উভয় প্রেডিক্টরের জন্য from_pretrained-এর মাধ্যমে মডেল লোড করা যায়।
- প্রশিক্ষণ এবং ফাইন-টিউনিং: কাস্টম ইমেজ, ভিডিও বা মিশ্র ডেটাসেটে প্রশিক্ষণ বা ফাইন-টিউনিংয়ের জন্য কোড প্রদান করা হয়েছে।
- ওয়েব ডেমো: হোস্ট করা SAM 2 ডেমোর মতো একটি লোকালি ডিপ্লয়যোগ্য ডেমোর জন্য ফ্রন্টএন্ড এবং ব্যাকএন্ড কোড।
- SA-V ডেটাসেট: এখন পর্যন্ত সবচেয়ে বড় ভিডিও সেগমেন্টেশন ডেটাসেট, যা মডেল-ইন-দ্য-লুপ ডেটা ইঞ্জিন দিয়ে তৈরি; ডেটাসেট ডকুমেন্টেশন অন্তর্ভুক্ত।
ইনস্টলেশনের জন্য Python 3.10+, PyTorch 2.5.1+ এবং TorchVision 0.20.1+ প্রয়োজন, সাথে কাস্টম কার্নেল কম্পাইল করার জন্য CUDA টুলকিট; Windows ব্যবহারকারীদের WSL ব্যবহার করার পরামর্শ দেওয়া হয়। ঐচ্ছিক এক্সট্রা হিসেবে নোটবুকের জন্য Jupyter এবং matplotlib ইনস্টল হয়। README-তে উল্লেখ করা হয়েছে যে CUDA এক্সটেনশন বিল্ড ব্যর্থ হলে তা উপেক্ষা করা যেতে পারে, শুধুমাত্র সীমিত পোস্ট-প্রসেসিং প্রভাব পড়ে। ডিসেম্বর ২০২৪-এর একটি আপডেটে ভিডিও অবজেক্ট সেগমেন্টেশনের গতি বাড়ানোর জন্য সম্পূর্ণ মডেল কম্পাইলেশন এবং একটি আপডেটেড SAM2VideoPredictor যুক্ত করা হয়েছে, যা স্বাধীন প্রতি-অবজেক্ট ইনফারেন্স এবং ট্র্যাকিং শুরুর পরে নতুন অবজেক্ট যোগ করার সুবিধা দেয়।
লাইসেন্সিং: মডেল চেকপয়েন্ট, ডেমো কোড এবং প্রশিক্ষণ কোড Apache 2.0-এর অধীনে, আর Inter Font এবং Noto Color Emoji SIL Open Font License 1.1-এর অধীনে। থার্ড-পার্টি GPU কানেক্টেড-কম্পোনেন্ট কোড cc_torch থেকে অভিযোজিত, যার নিজস্ব লাইসেন্স ফাইল রয়েছে।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.