इस प्रोजेक्ट के बारे में

LiveTalking एक ओपन-सोर्स रियल-टाइम इंटरेक्टिव स्ट्रीमिंग डिजिटल हैमन इंजन है, जो टेक्स्ट या वॉइस इनपुट से वर्चुअल अवतार को ऑडियो-विडियो सिंक डिस्प्ले के लिए चलाता है। यह प्रोजेक्ट ernerf, musetalk, wav2lip और Ultralight-Digital-Human समेत कई डिजिटल हैमन मॉडल्स को सपोर्ट करता है। इसमें वॉइस क्लोनिंग, डिस्ट्रबेंस हैंडलिंग, फुल-बॉडी विडियो टाइलिंग, एनीमेशन की व्यवस्था और कस्टम डिजिटल हैमन अवतार बनाने की सुविधा है। सिस्टम LLM के साथ कनेक्ट होकर रिप्लाई जनरेट करता है, फिर TTS के जरिए वॉइस सेंटलाइज करता है और डिजिटल हैमन को रियल-टाइम में लियरिप्स सिंक करता है। आउटपुट WebRTC, RTMP या व्हचुअल कैमरा के माध्यम से किया जा सकता है। इसमें ब्राउज़र पेज, HTTP API और डेस्कटॉप क्लाइंट जैसे कई एक्सेस मोड हैं। Avatar जनरेशन पेज और मैनेजमेंट बैकएंड भी शामिल हैं ताकि यूजर वीडियो अपलोड करके डिजिटल हैमन बना सकें,会话 स्टेटस मॉनिटर कर सकें और ग्लोबल कॉन्फ़िगरेशन एडजस्ट कर सकें। इसकी मॉड्यूलर आर्किटेक्चर में API लेयर, लॉजिक लेयर, रेंडरिंग लेयर, स्ट्रीमिंग लेयर और प्लगइन सिस्टम शामिल हैं। EdgeTTS, GPT-SoVITS, CosyVoice और Tencent Cloud जैसे TTS सॉल्यूशंस और Qwen जैसे बड़े भाषा मॉडल्स या OpenAI-कम्पैटिबिल गेटवे से इंटीग्रेशन सपोर्ट होता है। इसका उपयोग वirtual Anchor, लाइव-शॉपिंग, AI डिजिटल हैमन कस्टमर सर्विस, ऑनलाइन एजुकेशन, स्मार्ट वॉइस असिस्टेंट, बड़ी स्क्रीन प्रेजेंटेशन और शॉर्ट विडियो बेच निर्माण जैसे क्षेत्रों में किया जा सकता है। प्रोजेक्ट में इंस्टॉलेशन गाइड, Docker इमेज, API डॉक्युमेंटेशन और पर्फॉर्मेंस रेफरेंस उपलब्ध हैं, जो रियल-टाइम डिजिटल हैमन कनवर्सेशन और लाइव स्ट्रीमिंग चाहने वाले डेवलपर्स के लिए उपयोगी हैं।