इस प्रोजेक्ट के बारे में

Wan2.1 एक ओपन और एडवांस्ड लार्ज-स्केल वीडियो जनरेटिव मॉडल सुइट है। यह कई टास्क को सपोर्ट करता है, जिसमें टेक्स्ट-टू-वीडियो (T2V), इमेज-टू-वीडियो (I2V), फर्स्ट-लास्ट-फ्रेम-टू-वीडियो (FLF2V), वीडियो एडिटिंग, टेक्स्ट-टू-इमेज और वीडियो-टू-ऑडियो शामिल हैं। इस रिपॉजिटरी में 1.3B और 14B पैरामीटर मॉडल के मॉडल चेकपॉइंट्स उपलब्ध हैं, जो 480P और 720P रिज़ॉल्यूशन को सपोर्ट करते हैं। मुख्य क्षमताएं इस प्रकार हैं: - कंज्यूमर-ग्रे GPU सपोर्ट: T2V-1.3B मॉडल को केवल 8.19 GB VRAM की आवश्यकता होती है, जो स्टैंडर्ड GPU पर वीडियो जनरेशन को संभव बनाता है। - विजुअल टेक्स्ट जनरेशन: वीडियो के अंदर चीनी और अंग्रेजी दोनों टेक्स्ट जनरेट करने में सक्षम। - Wan-VAE: एक वीडियो VAE जो किसी भी लंबाई की 1080P वीडियो को एन्कोड और डिकोड करता है, जो टेम्पोरल जानकारी को संरक्षित रखता है। - VACE: वीडियो निर्माण और एडिटिंग के लिए एक ऑल-इन-वन मॉडल। रिपॉजिटरी FSDP और xDiT USP (Ulysses और Ring strategies) का उपयोग करते हुए सिंगल-GPU और मल्टी-GPU इंफरेंस स्क्रिप्ट्स प्रदान करती है। यह Dashscope API या लोकल Qwen मॉडल के माध्यम से प्रॉम्प्ट एक्सटेंशन को सपोर्ट करता है। Diffusers, ComfyUI और Gradio demos के साथ एकीकरण उपलब्ध है। मॉडल वेट Hugging Face और ModelScope पर उपलब्ध हैं।