इस प्रोजेक्ट के बारे में
# GPT-SoVITS
RVC-Boss द्वारा बनाया गया एक शक्तिशाली फ़ोर-शॉट वॉइस कन्वर्जन और टेक्स्ट-टू-स्पीच WebUI।
## अवलोकन
GPT-SoVITS न्यूनतम प्रशिक्षण डेटा के साथ वॉइस क्लोनिंग सक्षम करता है। 5 सेकंड का वोकल सैंपल ज़ीरो-शॉट TTS का समर्थन करता है, जबकि लगभग 1 मिनट का डेटा मॉडल को बेहतर वॉइस समानता और यथार्थवाद के लिए फ़ाइन-ट्यून करता है।
## प्रमुख विशेषताएं
1. **ज़ीरो-शॉट TTS** — त्वरित टेक्स्ट-टू-स्पीच रूपांतरण के लिए 5-सेकंड का वोकल सैंपल इनपुट करें।
2. **फ़ोर-शॉट TTS** — उच्च फ़िडेलिटी के लिए ~1 मिनट के प्रशिक्षण डेटा के साथ फ़ाइन-ट्यून करें।
3. **क्रॉस-लिंगुअल सपोर्ट** — प्रशिक्षण डेटासेट से भिन्न भाषाओं में इनफेरेंस, अंग्रेज़ी, जापानी, कोरियन, कانتonese और चीनी का समर्थन।
4. **WebUI टूल्स** — एकीकृत पाइपलाइन जिसमें शामिल हैं:
- UVR5 के माध्यम से वॉइस/ऑकॉम्पेनिमेंट सेपरेशन
- स्वचालित प्रशिक्षण सेट सेगमेंटेशन
- Fun-ASR-Nano, SenseVoice या क्लासिक FunASR का उपयोग करके बहुभाषी ASR
- डेटासेट निर्माण के लिए टेक्स्ट लेबलिंग
## वर्ज़न
- **v2**: कोरियन और कانتonese सपोर्ट जोड़ा गया, प्रीट्रेन्ड मॉडल्स 2k से 5k घंटे तक विस्तारित किए गए, कम गुणवत्ता वाले रेफ़रेंस ऑडियो के लिए सिंथेसिस गुणवत्ता में सुधार।
- **v3**: कम प्रशिक्षण डेटा के साथ उच्च टाइंबर समानता, कम दोहराव/छूट के साथ अधिक स्थिर GPT जनरेशन, समृद्ध भावनात्मक अभिव्यक्ति।
- **v4**: v3 में गैर-पूर्णांक अपसैंप्लिंग से धात्विक आर्टिफैक्ट्स को ठीक करता है; नेटिव रूप से 24k के बजाय 48k ऑडियो आउटपुट करता है।
- **v2Pro**: v2-स्तरीय हार्डवेयर आवश्यकताओं के साथ v4 प्रदर्शन से मेल खाता है।
## इंस्टॉलेशन
Windows, Linux (CUDA/ROCm), macOS (MPS/CPU) और Docker सहित समर्थित प्लेटफ़ॉर्म।
- Windows उपयोगकर्ता एक [एकीकृत पैकेज](https://huggingface.co/lj1995/GPT-SoVITS-windows-package) डाउनलोड कर सकते हैं और `go-webui.bat` चला सकते हैं।
- Conda-आधारित इंस्टॉल: `conda create -n GPTSoVits python=3.10 && conda activate GPTSoVits && bash install.sh`
- Docker images Docker Hub पर उपलब्ध हैं।
- क्लाउड ट्रेनिंग के लिए Colab notebooks प्रदान किए गए हैं।
## प्रीट्रेन्ड मॉडल्स
मॉडल्स Hugging Face से डाउनलोड किए जाते हैं और `GPT_SoVITS/pretrained_models` में रखे जाते हैं। G2PW (चीनी टेक्स्ट फ़्रंटएंड), UVR5 (वॉइस सेपरेशन), और ASR बैकएंड (FunASR, Faster Whisper) के लिए अतिरिक्त मॉडल्स की आवश्यकता होती है।
## डेटासेट फ़ॉर्मेट
एनोटेशन फ़ाइलों का फ़ॉर्मेट:
```
vocal_path|speaker_name|language|text
```
भाषा कोड: `zh` (चीनी), `ja` (जापानी), `en` (अंग्रेज़ी), `ko` (कोरियन), `yue` (कانتonese)।
## उपयोग
- WebUI लॉन्च करें: `python webui.py` या `python GPT_SoVITS/inference_webui.py`
- एकीकृत पैकेज उपयोगकर्ता: `go-webui.bat` / `go-webui-v2.bat` पर डबल-क्लिक करें
- UVR5 प्रोसेसिंग, ऑडियो सेगमेंटेशन, और ASR ट्रांस्क्रिप्शन के लिए कमांड-लाइन टूल्स उपलब्ध हैं।
## इनफेरेंस स्पीड
GPT-SoVITS v2 ProPlus के लिए RTF बेंचमार्क: RTX 4060 Ti पर 0.028, RTX 4090 पर 0.014, Apple M4 CPU पर 0.526। Hugging Face Spaces पर एक ऑनलाइन डेमो उपलब्ध है।
## क्रेडिट
VITS, SoundStorm, HiFi-GAN, BigVGAN और अन्य ओपन-सोर्स स्पीच सिंथेसिस प्रोजेक्ट्स के शोध पर निर्मित। WebUI टूल्स में UVR5, audio-slicer, FFmpeg, Gradio और FunASR शामिल हैं।
## लाइसेंस
MIT License।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.