इस प्रोजेक्ट के बारे में
SAM 2 (Segment Anything Model 2) Meta AI / FAIR का एक फाउंडेशन मॉडल है, जो छवियों और वीडियो दोनों में प्रॉम्प्टेबल विज़ुअल सेगमेंटेशन के लिए है। यह मूल SAM दृष्टिकोण को एक छवि को सिंगल-फ्रेम वीडियो के रूप में मानकर विस्तारित करता है, और रीयल-टाइम वीडियो प्रोसेसिंग के लिए स्ट्रीमिंग मेमोरी के साथ ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करता है। रिपॉजिटरी में आधिकारिक इन्फ्रेंस कोड, डाउनलोड करने योग्य प्रशिक्षित चेकपॉइंट, उदाहरण नोटबुक, प्रशिक्षण/फाइन-ट्यूनिंग कोड, और स्थानीय रूप से तैनात करने योग्य वेब डेमो शामिल है।
README में वर्णित प्रमुख क्षमताएँ:
- छवि भविष्यवाणी: SAM2ImagePredictor क्लास स्थिर छवियों पर प्रॉम्प्ट-आधारित सेगमेंटेशन के लिए SAM के समान इंटरफ़ेस प्रदान करती है, जिसमें स्वचालित मास्क जनरेशन शामिल है।
- वीडियो भविष्यवाणी: वीडियो प्रेडिक्टर पॉइंट या बॉक्स प्रॉम्प्ट जोड़ने, उन्हें परिष्कृत करने, और वीडियो में मास्कलेट्स का प्रचार करने का समर्थन करता है, साथ ही मल्टी-ऑब्जेक्ट ट्रैकिंग और प्रति-ऑब्जेक्ट इन्फ्रेंस स्टेट।
- मॉडल चेकपॉइंट: SAM 2.1 चेकपॉइंट (tiny, small, base_plus, large) सितंबर 2024 में जारी किए गए, साथ ही जुलाई 2024 के पहले SAM 2 चेकपॉइंट, SA-V, MOSE और LVOS v2 पर रिपोर्ट किए गए आकार, गति और बेंचमार्क आंकड़ों के साथ।
- Hugging Face लोडिंग: मॉडल को from_pretrained के माध्यम से छवि और वीडियो दोनों प्रेडिक्टर्स के लिए लोड किया जा सकता है।
- प्रशिक्षण और फाइन-ट्यूनिंग: कस्टम छवि, वीडियो, या मिश्रित डेटासेट पर प्रशिक्षण या फाइन-ट्यूनिंग के लिए कोड प्रदान किया गया है।
- वेब डेमो: होस्ट किए गए SAM 2 डेमो के समान स्थानीय रूप से तैनात करने योग्य डेमो के लिए फ्रंटएंड और बैकएंड कोड।
- SA-V डेटासेट: अब तक का सबसे बड़ा वीडियो सेगमेंटेशन डेटासेट, जो मॉडल-इन-द-लूप डेटा इंजन के साथ बनाया गया है; डेटासेट दस्तावेज़ीकरण शामिल है।
स्थापना के लिए Python 3.10+, PyTorch 2.5.1+ और TorchVision 0.20.1+ की आवश्यकता होती है, साथ ही कस्टम कर्नेल संकलित करने के लिए CUDA टूलकिट; Windows उपयोगकर्ताओं को WSL का उपयोग करने की सलाह दी जाती है। वैकल्पिक एक्स्ट्रा नोटबुक के लिए Jupyter और matplotlib स्थापित करते हैं। README नोट करता है कि असफल CUDA एक्सटेंशन बिल्ड को अनदेखा किया जा सकता है, केवल सीमित पोस्ट-प्रोसेसिंग प्रभाव के साथ। दिसंबर 2024 अपडेट में वीडियो ऑब्जेक्ट सेगमेंटेशन गति के लिए पूर्ण मॉडल संकलन और एक अद्यतन SAM2VideoPredictor जोड़ा गया, जो स्वतंत्र प्रति-ऑब्जेक्ट इन्फ्रेंस और ट्रैकिंग शुरू होने के बाद नई वस्तुओं को जोड़ने का समर्थन करता है।
लाइसेंसिंग: मॉडल चेकपॉइंट, डेमो कोड और प्रशिक्षण कोड Apache 2.0 के अंतर्गत हैं, Inter Font और Noto Color Emoji SIL Open Font License 1.1 के अंतर्गत हैं। तृतीय-पक्ष GPU कनेक्टेड-कंपोनेंट कोड cc_torch से अनुकूलित है और इसकी अपनी लाइसेंस फ़ाइल है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.