इस प्रोजेक्ट के बारे में
VoxCPM2 OpenBMB का एक ओपन-सोर्स टेक्स्ट-टू-स्पीच सिस्टम है जो डिस्क्रिट टोकनाइजेशन से बचता है और एंड-टू-एंड डिफ्यूज़न ऑटोरेग्रेसिव आर्किटेक्चर के माध्यम से निरंतरspeech प्रतिनिधित्व उत्पन्न करता है। नवीनतम 2B-पैरामीटर रिलीज़ बहुभाषी स्पीच डेटा पर प्रशिक्षित है और मандारिन, सुदानी, कैंटोनीज़ और वू सहित 30 भाषाओं का समर्थन करता है।
README में वर्णित मुख्य क्षमताओं में भाषा टैग के बिना बहुभाषी संश्लेषण, प्राकृतिक-भाषा विवरण (लिंग, आयु, लहजा, भावना, गति) से वॉइस डिज़ाइन, छोटे संदर्भ क्लिप से नियंत्रित वॉइस क्लोनिंग (वैकल्पिक शैली मार्गदर्शन के साथ), और "अंतिम क्लोनिंग" मोड शामिल है जो वॉयस सूक्ष्मताओं को पुन: उत्पन्न करने के लिए संदर्भ ऑडियो और उसके ट्रांसक्रिप्ट दोनों का उपयोग करता है। AudioVAE V2 का असममित एन्कोड/डीकोड डिज़ाइन 16kHz संदर्भ ऑडियो लेता है और ऑटो-सुपररेज़ोल्यूशन के साथ 48kHz ऑडियो आउटपुट देता है।
प्रोजेक्ट Python API, CLI, वेब डेमो, और स्ट्रीमिंग जनरेशन प्रदान करता है। डेप्लॉयमेंट विकल्पों में high-throughput सर्विंग के लिए Nano-vLLM, OpenAI-सुसंगत /v1/audio/speech एंडपॉइंट के लिए vLLM-Omni, और CPU, Metal, CUDA, या Vulkan पर GGUF वेट्स के साथ on-device C++ इनफेरेंस के लिए llama.cpp-omni शामिल हैं। SFT और LoRA के माध्यम से फाइन-ट्यूनिंग का समर्थन किया जाता है। वेट्स और कोड व्यावसायिक उपयोग के लिए Apache-2.0 के तहत जारी किए गए हैं।
README में Seed-TTS-eval पर बेंचमार्क परिणाम और जोखिम एवं सीमाओं की भी सूची दी गई है। यह अवलोकन केवल रिपॉज़िटरी के README पर आधारित है और प्रदर्शन दावों की स्वतंत्र रूप से सत्यापन नहीं करता है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.