عن المشروع

# GPT-SoVITS واجهة ويب قوية لتحويل الصوت باستخدام أمثلة قليلة والنص-إلى-نطق من تطوير RVC-Boss. ## نظرة عامة يتيح GPT-SoVITS استنساخ الصوت بحد أدنى من بيانات التدريب. عيّنة صوتية مدتها 5 ثوانٍ تدعم التوليد النصي-إلى-نطق الصامت (zero-shot)، بينما تقوم حوالي دقيقة واحدة من البيانات بضبط النموذج لتحسين تشابه الصوت وواقعيته. ## الميزات الرئيسية 1. **توليد نصي-إلى-نطق صامت** — أدخل عيّنة صوتية مدتها 5 ثوانٍ للتحويل الفوري من النص إلى كلام. 2. **توليد نصي-إلى-نطق ببيانات قليلة** — ضبط النموذج باستخدام ~دقيقة واحدة من بيانات التدريب للحصول على دقة أعلى. 3. **دعم عبر اللغات** — الاستدلال بلغات مختلفة عن لغة مجموعة التدريب، بدعم للغة الإنجليزية واليابانية والكورية والكانتونية والصينية. 4. **أدوات واجهة الويب** — خط أنابيب متكامل يشمل: - فصل الصوت/المصاحبة عبر UVR5 - تجزئة مجموعة التدريب تلقائياً - استخلاص نصي متعدد اللغات باستخدام Fun-ASR-Nano أو SenseVoice أو FunASR الكلاسيكي - وضع علامات نصية لإنشاء مجموعات البيانات ## الإصدارات - **v2**: أُضيف دعم الكورية والكانتونية، وتوسّعت النماذج المدربة مسبقاً من 2000 إلى 5000 ساعة، مع تحسين جودة التركيب للصوتيات المرجعية منخفضة الجودة. - **v3**: تشابه نبرة صوتية أعلى مع بيانات تدريب أقل، وتوليد GPT أكثر استقراراً مع تكرارات/حذف أقل، وتعابير عاطفية أغنى. - **v4**: يُصلح التشوّهات المعدنية الناتجة عن التسامي غير الصحيح في v3؛ ينتج صوتاً بدقة 48kHz بشكل أصلي بدلاً من 24kHz. - **v2Pro**: يُطابق أداء v4 مع متطلبات عتاد مستوى v2. ## التثبيت منصات مدعومة تشمل Windows وLinux (CUDA/ROCm) وmacOS (MPS/CPU) وDocker. - يمكن لمستخدمي Windows تنزيل [الحزمة المتكاملة](https://huggingface.co/lj1995/GPT-SoVITS-windows-package) وتشغيل `go-webui.bat`. - التثبيت عبر Conda: `conda create -n GPTSoVits python=3.10 && conda activate GPTSoVits && bash install.sh` - صور Docker متوفرة على Docker Hub. - تُوفَّر دفترعملات Colab للتدريب السحابي. ## النماذج المدربة مسبقاً تُحمّل النماذج من Hugging Face وتوضع في `GPT_SoVITS/pretrained_models`. تحتاج نماذج إضافية لـ G2PW (الواجهة الأمامية للنص الصيني) وUVR5 (فصل الصوت) وخلفيات ASR (FunASR وFaster Whisper). ## تنسيق مجموعة البيانات تستخدم ملفات التعليق النصي التنسيق التالي: ``` مسار_الصوت|اسم_المتحدث|اللغة|النص ``` رموز اللغة: `zh` (الصينية)، `ja` (اليابانية)، `en` (الإنجليزية)، `ko` (الكورية)، `yue` (الكانتونية). ## الاستخدام - بدء واجهة الويب: `python webui.py` أو `python GPT_SoVITS/inference_webui.py` - مستخدمو الحزمة المتكاملة: انقر نقر مزدوج على `go-webui.bat` / `go-webui-v2.bat` - تتوفر أدوات سطر الأوامر لمعالجة UVR5 وتجزئة الصوت والرنين النصي. ## سرعة الاستدلال مقاييس RTF لـ GPT-SoVITS v2 ProPlus: 0.028 على RTX 4060 Ti، و0.014 على RTX 4090، و0.526 على Apple M4 CPU.-demo عبر الإنترنت متاح على Hugging Face Spaces. ## الشكر والتقدير مبني على أبحاث من VITS وSoundStorm وHiFi-GAN وBigVGAN ومشاريع توليد الكلام مفتوحة المصدر الأخرى. تتضمن أدوات WebUI كل من UVR5 وaudio-slicer وFFmpeg وGradio وFunASR. ## الترخيص ترخيص MIT.