इस प्रोजेक्ट के बारे में

HunyuanVideo Tencent द्वारा विकसित एक ओपन-सोर्स वीडियो फाउंडेशन मॉडल है, जो व्यापक वीडियो जनरेशन के लिए डिज़ाइन किया गया है। इस रिपोजिटरी में PyTorch मॉडल परिभाषाएं, पूर्व-प्रशिक्षित वजन, और इनफरेंस/सैंपलिंग कोड उपलब्ध हैं। मुख्य तकनीकी विशेषताएं: - एकवद्ध छवि और वीडियो जेनेरेटिव आर्किटेक्चर: "Dual-stream to Single-stream" हाइब्रिड Transformer डिज़ाइन का उपयोग करता है, जिसमें पूर्ण एटेंशन तंत्र होता है जो वीडियो और टेक्स्ट टोकन्स को स्वतंत्र रूप से संसाधित करता है और फिर बहुआधार जानकारी एकीकरण के लिए उन्हें मिला देता है। - MLLM टेक्स्ट एनकोडर: टेक्स्ट एनकोडर के रूप में Decoder-Only संरचना वाले एक पूर्व-प्रशिक्षित मल्टिमॉडल लार्ज लैंग्वेज मॉडल का उपयोग करता है, जो CLIP या T5-XXL की तुलना में बेहतर छवि-टेक्स्ट एलाइनमेंट और जटिल तर्कशीलता प्रदान करता है। - 3D VAE: CausalConv3D के साथ एक Causal 3D VAE का उपयोग करता है, जो पिक्सेल-स्पেস वीडियो को कॉम्पैक्ट लेटेंट स्पेस में संपीड़ित करता है, जिसमें वीडियो लंबाई के लिए 4x, स्थान के लिए 8x, और चैनलों के लिए 16x संपीड़न अनुपात होते हैं। - प्रॉम्प्ट रीराइट: बेहतर वीडियो जनरेशन परिणामों के लिए उपयोगकर्ता प्रॉम्प्ट्स को अनुकूलित करने हेतु Normal और Master मोड के साथ fines-tuned प्रॉम्प्ट रीराइट मॉडल (Hunyuan-Large पर आधारित) शामिल है। मॉडल में 13 अरब से अधिक पैरामीटर हैं। रिपोजिटरी सिंगल-GPU इनफरेंस, xDiT के माध्यम से मल्टी-GPU पैरेलल इनफरेंस, और कम GPU मेमोरी उपयोग के लिए FP8 क्वांटाइज्ड वेट्स का समर्थन करती है। इसके लिए न्यूनतम 45GB GPU मेमोरी (544x960x129f के लिए) या 60GB (720x1280x129f के लिए) आवश्यक है, जबकि 80GB अनुशंसित है। इस प्रोजेक्ट से कई डेरिवेटिव निकले हैं, जिनमें HunyuanVideo-I2V (छवि-से-वीडियो), HunyuanVideo-Avatar (ऑडियो-चालित एनिमेशन), और HunyuanCustom (कस्टमाइज़्ड वीडियो जनरेशन) शामिल हैं। यह Diffusers और ComfyUI के साथ एकीकृत है, और सामुदायिक योगदान द्वारा क्वांटाइज्ड संस्करण, एक्सेलरेशन टूल्स, और विभिन्न अनुकूलन उपलब्ध हैं।