عن المشروع
# GPT-SoVITS
واجهة ويب قوية لتحويل الصوت باستخدام أمثلة قليلة والنص-إلى-نطق من تطوير RVC-Boss.
## نظرة عامة
يتيح GPT-SoVITS استنساخ الصوت بحد أدنى من بيانات التدريب. عيّنة صوتية مدتها 5 ثوانٍ تدعم التوليد النصي-إلى-نطق الصامت (zero-shot)، بينما تقوم حوالي دقيقة واحدة من البيانات بضبط النموذج لتحسين تشابه الصوت وواقعيته.
## الميزات الرئيسية
1. **توليد نصي-إلى-نطق صامت** — أدخل عيّنة صوتية مدتها 5 ثوانٍ للتحويل الفوري من النص إلى كلام.
2. **توليد نصي-إلى-نطق ببيانات قليلة** — ضبط النموذج باستخدام ~دقيقة واحدة من بيانات التدريب للحصول على دقة أعلى.
3. **دعم عبر اللغات** — الاستدلال بلغات مختلفة عن لغة مجموعة التدريب، بدعم للغة الإنجليزية واليابانية والكورية والكانتونية والصينية.
4. **أدوات واجهة الويب** — خط أنابيب متكامل يشمل:
- فصل الصوت/المصاحبة عبر UVR5
- تجزئة مجموعة التدريب تلقائياً
- استخلاص نصي متعدد اللغات باستخدام Fun-ASR-Nano أو SenseVoice أو FunASR الكلاسيكي
- وضع علامات نصية لإنشاء مجموعات البيانات
## الإصدارات
- **v2**: أُضيف دعم الكورية والكانتونية، وتوسّعت النماذج المدربة مسبقاً من 2000 إلى 5000 ساعة، مع تحسين جودة التركيب للصوتيات المرجعية منخفضة الجودة.
- **v3**: تشابه نبرة صوتية أعلى مع بيانات تدريب أقل، وتوليد GPT أكثر استقراراً مع تكرارات/حذف أقل، وتعابير عاطفية أغنى.
- **v4**: يُصلح التشوّهات المعدنية الناتجة عن التسامي غير الصحيح في v3؛ ينتج صوتاً بدقة 48kHz بشكل أصلي بدلاً من 24kHz.
- **v2Pro**: يُطابق أداء v4 مع متطلبات عتاد مستوى v2.
## التثبيت
منصات مدعومة تشمل Windows وLinux (CUDA/ROCm) وmacOS (MPS/CPU) وDocker.
- يمكن لمستخدمي Windows تنزيل [الحزمة المتكاملة](https://huggingface.co/lj1995/GPT-SoVITS-windows-package) وتشغيل `go-webui.bat`.
- التثبيت عبر Conda: `conda create -n GPTSoVits python=3.10 && conda activate GPTSoVits && bash install.sh`
- صور Docker متوفرة على Docker Hub.
- تُوفَّر دفترعملات Colab للتدريب السحابي.
## النماذج المدربة مسبقاً
تُحمّل النماذج من Hugging Face وتوضع في `GPT_SoVITS/pretrained_models`. تحتاج نماذج إضافية لـ G2PW (الواجهة الأمامية للنص الصيني) وUVR5 (فصل الصوت) وخلفيات ASR (FunASR وFaster Whisper).
## تنسيق مجموعة البيانات
تستخدم ملفات التعليق النصي التنسيق التالي:
```
مسار_الصوت|اسم_المتحدث|اللغة|النص
```
رموز اللغة: `zh` (الصينية)، `ja` (اليابانية)، `en` (الإنجليزية)، `ko` (الكورية)، `yue` (الكانتونية).
## الاستخدام
- بدء واجهة الويب: `python webui.py` أو `python GPT_SoVITS/inference_webui.py`
- مستخدمو الحزمة المتكاملة: انقر نقر مزدوج على `go-webui.bat` / `go-webui-v2.bat`
- تتوفر أدوات سطر الأوامر لمعالجة UVR5 وتجزئة الصوت والرنين النصي.
## سرعة الاستدلال
مقاييس RTF لـ GPT-SoVITS v2 ProPlus: 0.028 على RTX 4060 Ti، و0.014 على RTX 4090، و0.526 على Apple M4 CPU.-demo عبر الإنترنت متاح على Hugging Face Spaces.
## الشكر والتقدير
مبني على أبحاث من VITS وSoundStorm وHiFi-GAN وBigVGAN ومشاريع توليد الكلام مفتوحة المصدر الأخرى. تتضمن أدوات WebUI كل من UVR5 وaudio-slicer وFFmpeg وGradio وFunASR.
## الترخيص
ترخيص MIT.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.