इस प्रोजेक्ट के बारे में

MOSS-TTS-Nano MOSI.AI और OpenMOSS टीम का एक ओपन-सोर्स बहुभाषी भाषण जनरेशन मॉडल है। लगभग 0.1B पैरामीटर के साथ, यह रीयल-टाइम भाषण जनरेशन के लिए लक्षित है और GPU के बिना CPU पर चल सकता है, जिससे स्थानीय डेमो, वेब सर्विंग और हल्के एकीकरण के लिए डिप्लॉयमेंट सरल रहता है। README में वर्णित मुख्य विशेषताएँ: - लगभग 0.1B पैरामीटर का छोटा मॉडल आकार। - मूल 48 kHz, 2-चैनल (स्टीरियो) ऑडियो आउटपुट। - 20 भाषाओं के लिए बहुभाषी समर्थन, जिसमें चीनी, अंग्रेजी, जर्मन, स्पेनिश, फ्रेंच, जापानी, इतालवी, हंगेरियन, कोरियाई, रूसी, फारसी, अरबी, पोलिश, पुर्तगाली, चेक, डेनिश, स्वीडिश, ग्रीक और तुर्की शामिल हैं। - ऑडियो टोकनाइज़र प्लस LLM पाइपलाइन पर निर्मित शुद्ध ऑटोरेग्रेसिव आर्किटेक्चर। - कम रीयल-टाइम विलंबता और तेज़ पहले ऑडियो के साथ स्ट्रीमिंग इन्फ्रेंस। - CPU-अनुकूल: स्ट्रीमिंग जनरेशन 4-कोर CPU पर चल सकता है। - स्वचालित चंक्ड वॉयस क्लोनिंग के साथ लंबे-पाठ क्षमता। - सीधे Python स्क्रिप्ट और पैकेज्ड CLI के माध्यम से ओपन-सोर्स डिप्लॉयमेंट पथ। क्विकस्टार्ट: README एक साफ Python वातावरण, रिपॉजिटरी क्लोन करने, आवश्यकताएँ स्थापित करने और प्रोजेक्ट को संपादन योग्य मोड में स्थापित करने की सलाह देता है ताकि moss-tts-nano कमांड उपलब्ध हो जाए। डिफ़ॉल्ट मॉडल लोडिंग OpenMOSS-Team/MOSS-TTS-Nano और OpenMOSS-Team/MOSS-Audio-Tokenizer-Nano का उपयोग करती है। वॉयस क्लोनिंग मुख्य अनुशंसित वर्कफ़्लो है, जिसे infer.py के साथ प्रॉम्प्ट ऑडियो पथ और इनपुट टेक्स्ट का उपयोग करके प्रदर्शित किया गया है। एक स्थानीय FastAPI वेब डेमो app.py के साथ लॉन्च किया जा सकता है और 127.0.0.1:18083 पर खोला जा सकता है। ONNX CPU इन्फ्रेंस: हल्के स्थानीय डिप्लॉयमेंट के लिए ONNX CPU संस्करण की सिफारिश की जाती है। यह इन्फ्रेंस के दौरान PyTorch निर्भरता को हटाता है, ONNX Runtime CPU पर चलता है, सीधे संदर्भ ऑडियो, अंतर्निहित आवाज़ें और रीयलटाइम स्ट्रीमिंग डिकोड का समर्थन करता है, और परियोजना के परीक्षणों में मूल संस्करण की तुलना में लगभग 2x अधिक प्रोसेसिंग-कुशल बताया गया है। MacBook Air M4 पर, एकल CPU कोर के साथ सुचारू इन्फ्रेंस देखा गया। ONNX एंट्रीपॉइंट में infer_onnx.py, app_onnx.py और --backend onnx के साथ पैकेज्ड CLI शामिल हैं। CUDA निष्पादन onnxruntime-gpu और --execution-provider cuda के माध्यम से वैकल्पिक है। पहले रन पर ONNX Hugging Face रिपॉजिटरी से लापता मॉडल फ़ाइलें डाउनलोड की जाती हैं। अतिरिक्त टूलिंग: examples/android_onnx_runtime के तहत एक Android ONNX Runtime उदाहरण डिवाइस पर निर्यात किए गए ONNX ग्राफ़ लोड करता है और WAV फ़ाइल लिखता है। onnx/ के तहत एक एक्सपोर्टर स्थानीय Hugging Face-प्रारूप चेकपॉइंट को TTS-केवल ONNX मॉडल निर्देशिका में परिवर्तित करता है। पैकेज्ड CLI moss-tts-nano generate और moss-tts-nano serve कमांड प्रदान करता है, जिसमें प्रॉम्प्ट स्पीच, टेक्स्ट फ़ाइलें, बैकएंड चयन और निष्पादन प्रदाता के विकल्प हैं। फाइनट्यूनिंग कोड और ट्यूटोरियल finetuning निर्देशिका में प्रदान किए गए हैं। रिपॉजिटरी MOSS-Audio-Tokenizer-Nano का भी दस्तावेजीकरण करती है, जो Cat (Causal Audio Tokenizer with Transformer) आर्किटेक्चर पर निर्मित लगभग 20 मिलियन पैरामीटर का हल्का टोकनाइज़र है। यह 48 kHz स्टीरियो इनपुट और आउटपुट का समर्थन करता है, ऑडियो को 12.5 Hz टोकन स्ट्रीम में संपीड़ित करता है, और 0.125 kbps से 2 kbps तक परिवर्तनीय बिटरेट में 16 कोडबुक के साथ RVQ का उपयोग करता है। मूल्यांकन तालिकाएँ और प्लॉट भाषण, ऑडियो और संगीत डेटा पर 120M से अधिक पैरामीटर वाले ओपन-सोर्स टोकनाइज़र के खिलाफ पुनर्निर्माण गुणवत्ता की तुलना करते हैं। व्यापक MOSS-TTS परिवार का भी वर्णन किया गया है, जिसमें MOSS-TTS, MOSS-TTS-Local-Transformer, MOSS-TTSD-v1.0, MOSS-VoiceGenerator, MOSS-SoundEffect और MOSS-TTS-Realtime शामिल हैं, जिनमें Hugging Face और ModelScope पर मॉडल वेट के लिंक हैं।