इस प्रोजेक्ट के बारे में
Open-Sora एक ओपन-सोर्स परियोजना है जो सुलभ मॉडल्स, टूल्स और कार्यान्वयन विवरण प्रदान करके कुशल वीडियो उत्पादन को लोकतांत्रीकृत करने के लिए समर्पित है। यह डेटा पूर्वप्रसंस्करण, प्रशिक्षण त्वरण (ColossalAI का उपयोग करके) और इनference सहित वीडियो जेनरेशन के लिए एक पूर्ण पाइपलाइन प्रदान करता है।
नवीनतम रिलीज़, Open-Sora 2.0, में 11B पैरामीटर वाला मॉडल है। परियोजना के तकनीकी रिपोर्ट के अनुसार, इस मॉडल को लगभग $200K के बजट में प्रशिक्षित किया गया था और यह VBench बेंचमार्क और मानव प्राथमिकता मूल्यांकन पर HunyuanVideo (11B) और Step-Video (30B) जैसे अन्य ओपन-सोर्स मॉडल्स के बराबर प्रदर्शन प्राप्त करता है। परियोजना पिछले संस्करणों (1.0 से 1.3 तक) को अलग-अलग शाखाओं पर बनाए रखती है, जहां 3D-VAE, rectified flow, और विभिन्न spatial-temporal आर्किटेक्चर जैसे क्षेत्रों में क्षमताओं में पुनरावृत्तिक विकास दस्तावेज किया गया है।
प्रमुख क्षमताएँ और सुविधाएँ:
- टेक्स्ट-टू-इमेज, टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो, और वीडियो-टू-वीडियो जेनरेशन।
- 2 सेकंड से 16 सेकंड या अनंत समय तक विभिन्न वीडियो लंबाइयों और 144p से 720p तक रिज़ॉल्यूशन के लिए समर्थन, लचीले एस्पेक्ट रेशियो के साथ।
- पूर्ण रूप से ओपन-सोर्स चेकप्वाइंट्स और प्रशिक्षण स्क्रिप्ट्स, जो उपयोगकर्ताओं को अपने स्वयं के मॉडल्स को प्रशिक्षित या फाइन-ट्यून करने की अनुमति देते हैं।
- प्रत्येक संस्करण के लिए आर्किटेक्चर, प्रशिक्षण प्रक्रियाओं और मूल्यांकन मेट्रिक्स को दस्तावेज़ करने वाले विस्तृत तकनीकी रिपोर्ट।
- इंटरैक्टिव टेस्टिंग के लिए Hugging Face Spaces पर होस्ट किए गए Gradio-आधारित डेमो।
परियोजना प्रशिक्षण, वीडियो ऑटोएन्कोडर्स का मूल्यांकन और मॉडल्स को तैनात करने के लिए व्यापक दस्तावेज़ीकरण प्रदान करती है, जिसका उद्देश्य सामग्री निर्माताओं और शोधकर्ताओं के लिए वीडियो जेनरेशन की जटिलताओं को सरल बनाना है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.