منصوبے کے بارے میں
# GPT-SoVITS
آر وی سی-بوس کی جانب سے تیار کردہ ایک طاقتور فیو-شوٹس آواز کی تبدیلی اور ٹیکسٹ-ٹو-اسپیچ WebUI۔
## جائزہ
GPT-SoVITS کم از کم ٹریننگ ڈیٹا کے ساتھ آواز کی نقل ممکن بناتا ہے۔ 5 سیکنڈ کی واکل نمونہ زیرو شوٹ TTS کی حمایت کرتا ہے، جبکہ تقریباً 1 منٹ کا ڈیٹا ماڈل کو بہتر آواز کی مشابہت اور حقیقت پسندی کے لیے فی-ٹائن کرتا ہے۔
## اہم خصوصیات
1. **زیرو شوٹ TTS** — فوری ٹیکسٹ-ٹو-اسپیچ تبدیلی کے لیے 5 سیکنڈ کا واکل نمونہ درکار ہے۔
2. **فو شوٹ TTS** — زیادہ fidelity کے لیے ~1 منٹ کی ٹریننگ ڈیٹا کے ساتھ فی-ٹائن کریں۔
3. **کراس-لنگول سپورٹ** — ٹریننگ ڈیٹا سے مختلف زبانوں میں inferencing، انگریزی، جاپانی، کورین، کینٹونیز اور چینی کی حمایت کرتا ہے۔
4. **WebUI ٹولز** — شمولیتی پائپ لائن بشمول:
- UVR5 کے ذریعے آواز/ساتھ دینے والی علیحدگی
- خودکار ٹریننگ سیٹ segmentation
- Fun-ASR-Nano، SenseVoice یا کلاسک FunASR کا استعمال کرتے ہوئے ملٹی لنگول ASR
- ڈیٹاسیٹ تخلیق کے لیے ٹیکسٹ لیبلنگ
## ورژنز
- **v2**: کورین اور کینٹونیز سپورٹ شامل کی گئی، pretrained ماڈلز 2h سے 5k hours تک پھیلائے گئے، کم معیار کے ریفرنس آڈیو کے لیے synthesis معیار بہتر بنایا گیا۔
- **v3**: کم ٹریننگ ڈیٹا کے ساتھ زیادہ timbre مشابہت، کم repetition/omission کے ساتھ زیادہ مستحکم GPT جنریشن، امیر جذباتی اظہار۔
- **v4**: v3 میں non-integer upsampling سے metallic artifacts کو ٹھیک کرتا ہے; 24k کے بجائے natively 48k آڈیو output کرتا ہے۔
- **v2Pro**: v2 لیول کے ہارڈویئر ضروریات کے ساتھ v4 کے performance کے برابر۔
## انسٹالیشن
Windows، Linux (CUDA/ROCm)، macOS (MPS/CPU)، اور Docker سمیت تمام پلیٹ فارمز سپورٹڈ ہیں۔
- Windows صارفین [integrated package](https://huggingface.co/lj1995/GPT-SoVITS-windows-package) ڈاؤنلوڈ کر سکتے ہیں اور `go-webui.bat` چلا سکتے ہیں۔
- Conda-based انسٹال: `conda create -n GPTSoVits python=3.10 && conda activate GPTSoVits && bash install.sh`
- Docker images Docker Hub پر دستیاب ہیں۔
- کلاؤڈ ٹریننگ کے لیے Colab notebooks فراہم کیے گئے ہیں۔
## pretrained ماڈلز
ماڈلز Hugging Face سے download ہوتے ہیں اور `GPT_SoVITS/pretrained_models` میں رکھے جاتے ہیں۔ G2PW (چینی ٹیکسٹ frontend)، UVR5 (آواز separation)، اور ASR backends (FunASR, Faster Whisper) کے لیے اضافی ماڈلز درکار ہیں۔
## ڈیٹاسیٹ فارمیٹ
Annotation فائلیں مندرجہ ذیل فارمیٹ میں ہوتی ہیں:
```
vocal_path|speaker_name|language|text
```
Language codes: `zh` (چینی)، `ja` (جاپانی)، `en` (انگریزی)، `ko` (کورین)، `yue` (کینٹونیز)۔
## استعمال
- WebUI شروع کریں: `python webui.py` یا `python GPT_SoVITS/inference_webui.py`
- Integrated package صارفین: `go-webui.bat` / `go-webui-v2.bat` پر double-click کریں
- UVR5 processing، audio segmentation، اور ASR transcription کے لیے command-line tools دستیاب ہیں۔
## inference رفتار
GPT-SoVITS v2 ProPlus کے لیے RTF benchmarks: RTX 4060 Ti پر 0.028، RTX 4090 پر 0.014، Apple M4 CPU پر 0.526۔ Hugging Face Spaces پر ایک online demo دستیاب ہے۔
## کریڈٹس
VITS، SoundStorm، HiFi-GAN، BigVGAN اور دیگر open-source speech synthesis projects کی تحقیق پر مبنی۔ WebUI ٹولز میں UVR5، audio-slicer، FFmpeg، Gradio، اور FunASR شامل ہیں۔
## لائسنس
MIT License۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.