À propos du projet
# GPT-SoVITS
Une puissante WebUI de conversion vocale few-shot et de synthèse text-to-speech par RVC-Boss.
## Aperçu
GPT-SoVITS permet le clonage vocal avec un minimum de données d'entraînement. Un échantillon vocal de 5 secondes suffit pour du TTS zero-shot, tandis qu'environ 1 minute de données permet un fine-tuning pour améliorer la similarité vocale et le réalisme.
## Fonctionnalités clés
1. **TTS zero-shot** — Fournissez un échantillon vocal de 5 secondes pour une conversion texte-parole instantanée.
2. **TTS few-shot** — Effectuez un fine-tuning avec ~1 minute de données d'entraînement pour une fidélité supérieure.
3. **Support multilingue** — Inférence dans des langues différentes du jeu de données d'entraînement, prenant en charge l'anglais, le japonais, le coréen, le cantonais et le chinois.
4. **Outils WebUI** — Pipeline intégré incluant :
- Séparation voix/accompagnement via UVR5
- Segmentation automatique du jeu de données d'entraînement
- RSA multilingue via Fun-ASR-Nano, SenseVoice ou FunASR classique
- Étiquetage de texte pour la création de jeu de données
## Versions
- **v2** : Ajout du support coréen et cantonais, expansion des modèles pré-entraînés de 2k à 5k heures, amélioration de la qualité de synthèse pour les audio de référence de faible qualité.
- **v3** : Similarité timbrale accrue avec moins de données d'entraînement, génération GPT plus stable avec moins de répétitions/omissions, expression émotionnelle plus riche.
- **v4** : Correction des artefacts métalliques dus au redimensionnement non entier dans v3 ; sortie native en audio 48k au lieu de 24k.
- **v2Pro** : Performances équivalentes à v4 avec des exigences matérielles de niveau v2.
## Installation
Les plateformes prises en charge incluent Windows, Linux (CUDA/ROCm), macOS (MPS/CPU) et Docker.
- Les utilisateurs Windows peuvent télécharger un [pack intégré](https://huggingface.co/lj1995/GPT-SoVITS-windows-package) et exécuter `go-webui.bat`.
- Installation Conda : `conda create -n GPTSoVits python=3.10 && conda activate GPTSoVits && bash install.sh`
- Des images Docker sont disponibles sur Docker Hub.
- Des notebooks Colab sont fournis pour l'entraînement cloud.
## Modèles pré-entraînés
Les modèles sont téléchargés depuis Hugging Face et placés dans `GPT_SoVITS/pretrained_models`. Des modèles supplémentaires sont nécessaires pour G2PW (frontend texte chinois), UVR5 (séparation vocale) et les backends RSA (FunASR, Faster Whisper).
## Format des données
Les fichiers d'annotation utilisent le format :
```
chemin_vocal|nom_speaker|langue|texte
```
Codes langue : `zh` (chinois), `ja` (japonais), `en` (anglais), `ko` (coréen), `yue` (cantonnais).
## Utilisation
- Lancer WebUI : `python webui.py` ou `python GPT_SoVITS/inference_webui.py`
- Utilisateurs du pack intégré : double-cliquez sur `go-webui.bat` / `go-webui-v2.bat`
- Des outils en ligne de commande sont disponibles pour le traitement UVR5, la segmentation audio et la transcription RSA.
## Vitesse d'inférence
Mesures RTF pour GPT-SoVITS v2 ProPlus : 0,028 sur RTX 4060 Ti, 0,014 sur RTX 4090, 0,526 sur CPU Apple M4. Une démo en ligne est disponible sur Hugging Face Spaces.
## Crédits
Construit sur la base des recherches de VITS, SoundStorm, HiFi-GAN, BigVGAN et d'autres projets open-source de synthèse vocale. Les outils WebUI incluent UVR5, audio-slicer, FFmpeg, Gradio et FunASR.
## Licence
Licence MIT.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.