इस प्रोजेक्ट के बारे में

CogVideoX QingYing से निकला एक ओपन-सॉर्स वीडियो जेनरेशन मॉडल है। रिपाज़िटरी में CogVideoX-2B, CogVideoX-5B, CogVideoX-5B-I2V और नवीनतम CogVideoX1.5-5B सीरीज़ सहित कई मॉडल्स उपलब्ध हैं। ये मॉडल्स टेक्सट-टू-वीडियो जेनरेशन, इमेज-टू-वीडियो जेनरेशन और वीडियो कंटिन्यूएशन के तीन मुख्य कार्यों का समर्थन करते हैं। CogVideoX1.5-5B मॉडल्स 1360x768 रिज़ोल्यूशन तक 10-सेकंड के वीडियो सपोर्ट करते हैं, जबकि पूर्व मॉडल्स 720x480 रिज़ोल्यूशन पर 6-सेकंड के वीडियो जनरेट करते हैं। I2V (इमेज-टू-वीडियो) वेरिएंट 768 पिक्सेल न्यूनतम आयाम के साथ वैरिएबल रिज़ोल्यूशन सपोर्ट करता है। मॉडल्स अंग्रेजी प्रॉम्प्ट्स स्वीकार करते हैं जिनकी टोकन सीमा 224-226 टोकन होती है। Diffusers और SAT (SwissArmyTransformer) के माध्यम से इन्फ़्रेंस सपोर्ट किया जाता है। Diffusers वर्ज़न सीक्वेंशियल CPU ऑफ़लोड, VAE स्लिसिंग और VAE टाइलिंग सहित मेमोरी ऑप्टिमाइज़ेशन सपोर्ट करता है, जिससे कंज़्यूमर GPU पर इन्फ़्रेंस संभव होता है। CogVideoX-2B GTX 1080 Ti पर चल सकता है, जबकि CogVideoX-5B RTX 3060 श्रेणी के GPU पर चलता है। TorchAO के माध्यम से क्वांटाइज़्ड इन्फ़्रेंस INT8 प्रेसिज़न सपोर्ट करता है, जिससे मेमोरी आवश्यकताएं और कम हो जाती हैं। रिपाज़िटरी में मुफ़्त T4 इंस्टैंस पर T2V, I2V और V2V टास्क्स के लिए Colab नोटबुक भी उपलब्ध हैं। LoRA ट्रेनिंग के माध्यम से फाइन-ट्यूनिंग सपोर्ट किया जाता है जिसमें GPU मेमोरी की आवश्यकता कम होती है, और CogKit टूलकिट CogView4 और CogVideoX सीरीज़ में फाइन-ट्यूनिंग और इन्फ़्रेंस के लिए एक एकताबद्ध फ्रेमवर्क प्रदान करता है। एक सामुदायिक-विकासित फाइन-ट्यूनिंग फ्रेमवर्क (cogvideox-factory) के साथ CogVideoX-5B को सिंगल 4090 GPU पर फाइन-ट्यून किया जा सकता है। रिपाज़िटरी में DDIM इन्वर्ज़न सपोर्ट, बड़े भाषा मॉडल्स का उपयोग करके प्रॉम्प्ट ऑप्टिमाइज़ेशन गाइड, और CogVLM2-Caption मॉडल भी शामिल है जिसे ट्रेनिंग के दौरान वीडियो डेटा को टेक्स्ट डिस्क्रिप्शन में बदलने के लिए उपयोग किया जाता है। मूल CogVideo मॉडल (ICLR 2023) एक अलग ब्रांच में उपलब्ध है, जो पहला ओपन-सॉर्स ट्रान्सफ़ॉर्मर-आधारित टेक्सट-टू-वीडियो जेनरेशन मॉडल था। CogVideoX-2B Apache 2.0 लाइसेंस के तहत जारी किया गया है।