منصوبے کے بارے میں

# GPT-SoVITS آر وی سی-بوس کی جانب سے تیار کردہ ایک طاقتور فیو-شوٹس آواز کی تبدیلی اور ٹیکسٹ-ٹو-اسپیچ WebUI۔ ## جائزہ GPT-SoVITS کم از کم ٹریننگ ڈیٹا کے ساتھ آواز کی نقل ممکن بناتا ہے۔ 5 سیکنڈ کی واکل نمونہ زیرو شوٹ TTS کی حمایت کرتا ہے، جبکہ تقریباً 1 منٹ کا ڈیٹا ماڈل کو بہتر آواز کی مشابہت اور حقیقت پسندی کے لیے فی-ٹائن کرتا ہے۔ ## اہم خصوصیات 1. **زیرو شوٹ TTS** — فوری ٹیکسٹ-ٹو-اسپیچ تبدیلی کے لیے 5 سیکنڈ کا واکل نمونہ درکار ہے۔ 2. **فو شوٹ TTS** — زیادہ fidelity کے لیے ~1 منٹ کی ٹریننگ ڈیٹا کے ساتھ فی-ٹائن کریں۔ 3. **کراس-لنگول سپورٹ** — ٹریننگ ڈیٹا سے مختلف زبانوں میں inferencing، انگریزی، جاپانی، کورین، کینٹونیز اور چینی کی حمایت کرتا ہے۔ 4. **WebUI ٹولز** — شمولیتی پائپ لائن بشمول: - UVR5 کے ذریعے آواز/ساتھ دینے والی علیحدگی - خودکار ٹریننگ سیٹ segmentation - Fun-ASR-Nano، SenseVoice یا کلاسک FunASR کا استعمال کرتے ہوئے ملٹی لنگول ASR - ڈیٹاسیٹ تخلیق کے لیے ٹیکسٹ لیبلنگ ## ورژنز - **v2**: کورین اور کینٹونیز سپورٹ شامل کی گئی، pretrained ماڈلز 2h سے 5k hours تک پھیلائے گئے، کم معیار کے ریفرنس آڈیو کے لیے synthesis معیار بہتر بنایا گیا۔ - **v3**: کم ٹریننگ ڈیٹا کے ساتھ زیادہ timbre مشابہت، کم repetition/omission کے ساتھ زیادہ مستحکم GPT جنریشن، امیر جذباتی اظہار۔ - **v4**: v3 میں non-integer upsampling سے metallic artifacts کو ٹھیک کرتا ہے; 24k کے بجائے natively 48k آڈیو output کرتا ہے۔ - **v2Pro**: v2 لیول کے ہارڈویئر ضروریات کے ساتھ v4 کے performance کے برابر۔ ## انسٹالیشن Windows، Linux (CUDA/ROCm)، macOS (MPS/CPU)، اور Docker سمیت تمام پلیٹ فارمز سپورٹڈ ہیں۔ - Windows صارفین [integrated package](https://huggingface.co/lj1995/GPT-SoVITS-windows-package) ڈاؤنلوڈ کر سکتے ہیں اور `go-webui.bat` چلا سکتے ہیں۔ - Conda-based انسٹال: `conda create -n GPTSoVits python=3.10 && conda activate GPTSoVits && bash install.sh` - Docker images Docker Hub پر دستیاب ہیں۔ - کلاؤڈ ٹریننگ کے لیے Colab notebooks فراہم کیے گئے ہیں۔ ## pretrained ماڈلز ماڈلز Hugging Face سے download ہوتے ہیں اور `GPT_SoVITS/pretrained_models` میں رکھے جاتے ہیں۔ G2PW (چینی ٹیکسٹ frontend)، UVR5 (آواز separation)، اور ASR backends (FunASR, Faster Whisper) کے لیے اضافی ماڈلز درکار ہیں۔ ## ڈیٹاسیٹ فارمیٹ Annotation فائلیں مندرجہ ذیل فارمیٹ میں ہوتی ہیں: ``` vocal_path|speaker_name|language|text ``` Language codes: `zh` (چینی)، `ja` (جاپانی)، `en` (انگریزی)، `ko` (کورین)، `yue` (کینٹونیز)۔ ## استعمال - WebUI شروع کریں: `python webui.py` یا `python GPT_SoVITS/inference_webui.py` - Integrated package صارفین: `go-webui.bat` / `go-webui-v2.bat` پر double-click کریں - UVR5 processing، audio segmentation، اور ASR transcription کے لیے command-line tools دستیاب ہیں۔ ## inference رفتار GPT-SoVITS v2 ProPlus کے لیے RTF benchmarks: RTX 4060 Ti پر 0.028، RTX 4090 پر 0.014، Apple M4 CPU پر 0.526۔ Hugging Face Spaces پر ایک online demo دستیاب ہے۔ ## کریڈٹس VITS، SoundStorm، HiFi-GAN، BigVGAN اور دیگر open-source speech synthesis projects کی تحقیق پر مبنی۔ WebUI ٹولز میں UVR5، audio-slicer، FFmpeg، Gradio، اور FunASR شامل ہیں۔ ## لائسنس MIT License۔