इस प्रोजेक्ट के बारे में

# GPT-SoVITS RVC-Boss द्वारा बनाया गया एक शक्तिशाली फ़ोर-शॉट वॉइस कन्वर्जन और टेक्स्ट-टू-स्पीच WebUI। ## अवलोकन GPT-SoVITS न्यूनतम प्रशिक्षण डेटा के साथ वॉइस क्लोनिंग सक्षम करता है। 5 सेकंड का वोकल सैंपल ज़ीरो-शॉट TTS का समर्थन करता है, जबकि लगभग 1 मिनट का डेटा मॉडल को बेहतर वॉइस समानता और यथार्थवाद के लिए फ़ाइन-ट्यून करता है। ## प्रमुख विशेषताएं 1. **ज़ीरो-शॉट TTS** — त्वरित टेक्स्ट-टू-स्पीच रूपांतरण के लिए 5-सेकंड का वोकल सैंपल इनपुट करें। 2. **फ़ोर-शॉट TTS** — उच्च फ़िडेलिटी के लिए ~1 मिनट के प्रशिक्षण डेटा के साथ फ़ाइन-ट्यून करें। 3. **क्रॉस-लिंगुअल सपोर्ट** — प्रशिक्षण डेटासेट से भिन्न भाषाओं में इनफेरेंस, अंग्रेज़ी, जापानी, कोरियन, कانتonese और चीनी का समर्थन। 4. **WebUI टूल्स** — एकीकृत पाइपलाइन जिसमें शामिल हैं: - UVR5 के माध्यम से वॉइस/ऑकॉम्पेनिमेंट सेपरेशन - स्वचालित प्रशिक्षण सेट सेगमेंटेशन - Fun-ASR-Nano, SenseVoice या क्लासिक FunASR का उपयोग करके बहुभाषी ASR - डेटासेट निर्माण के लिए टेक्स्ट लेबलिंग ## वर्ज़न - **v2**: कोरियन और कانتonese सपोर्ट जोड़ा गया, प्रीट्रेन्ड मॉडल्स 2k से 5k घंटे तक विस्तारित किए गए, कम गुणवत्ता वाले रेफ़रेंस ऑडियो के लिए सिंथेसिस गुणवत्ता में सुधार। - **v3**: कम प्रशिक्षण डेटा के साथ उच्च टाइंबर समानता, कम दोहराव/छूट के साथ अधिक स्थिर GPT जनरेशन, समृद्ध भावनात्मक अभिव्यक्ति। - **v4**: v3 में गैर-पूर्णांक अपसैंप्लिंग से धात्विक आर्टिफैक्ट्स को ठीक करता है; नेटिव रूप से 24k के बजाय 48k ऑडियो आउटपुट करता है। - **v2Pro**: v2-स्तरीय हार्डवेयर आवश्यकताओं के साथ v4 प्रदर्शन से मेल खाता है। ## इंस्टॉलेशन Windows, Linux (CUDA/ROCm), macOS (MPS/CPU) और Docker सहित समर्थित प्लेटफ़ॉर्म। - Windows उपयोगकर्ता एक [एकीकृत पैकेज](https://huggingface.co/lj1995/GPT-SoVITS-windows-package) डाउनलोड कर सकते हैं और `go-webui.bat` चला सकते हैं। - Conda-आधारित इंस्टॉल: `conda create -n GPTSoVits python=3.10 && conda activate GPTSoVits && bash install.sh` - Docker images Docker Hub पर उपलब्ध हैं। - क्लाउड ट्रेनिंग के लिए Colab notebooks प्रदान किए गए हैं। ## प्रीट्रेन्ड मॉडल्स मॉडल्स Hugging Face से डाउनलोड किए जाते हैं और `GPT_SoVITS/pretrained_models` में रखे जाते हैं। G2PW (चीनी टेक्स्ट फ़्रंटएंड), UVR5 (वॉइस सेपरेशन), और ASR बैकएंड (FunASR, Faster Whisper) के लिए अतिरिक्त मॉडल्स की आवश्यकता होती है। ## डेटासेट फ़ॉर्मेट एनोटेशन फ़ाइलों का फ़ॉर्मेट: ``` vocal_path|speaker_name|language|text ``` भाषा कोड: `zh` (चीनी), `ja` (जापानी), `en` (अंग्रेज़ी), `ko` (कोरियन), `yue` (कانتonese)। ## उपयोग - WebUI लॉन्च करें: `python webui.py` या `python GPT_SoVITS/inference_webui.py` - एकीकृत पैकेज उपयोगकर्ता: `go-webui.bat` / `go-webui-v2.bat` पर डबल-क्लिक करें - UVR5 प्रोसेसिंग, ऑडियो सेगमेंटेशन, और ASR ट्रांस्क्रिप्शन के लिए कमांड-लाइन टूल्स उपलब्ध हैं। ## इनफेरेंस स्पीड GPT-SoVITS v2 ProPlus के लिए RTF बेंचमार्क: RTX 4060 Ti पर 0.028, RTX 4090 पर 0.014, Apple M4 CPU पर 0.526। Hugging Face Spaces पर एक ऑनलाइन डेमो उपलब्ध है। ## क्रेडिट VITS, SoundStorm, HiFi-GAN, BigVGAN और अन्य ओपन-सोर्स स्पीच सिंथेसिस प्रोजेक्ट्स के शोध पर निर्मित। WebUI टूल्स में UVR5, audio-slicer, FFmpeg, Gradio और FunASR शामिल हैं। ## लाइसेंस MIT License।