À propos du projet

# GPT-SoVITS Une puissante WebUI de conversion vocale few-shot et de synthèse text-to-speech par RVC-Boss. ## Aperçu GPT-SoVITS permet le clonage vocal avec un minimum de données d'entraînement. Un échantillon vocal de 5 secondes suffit pour du TTS zero-shot, tandis qu'environ 1 minute de données permet un fine-tuning pour améliorer la similarité vocale et le réalisme. ## Fonctionnalités clés 1. **TTS zero-shot** — Fournissez un échantillon vocal de 5 secondes pour une conversion texte-parole instantanée. 2. **TTS few-shot** — Effectuez un fine-tuning avec ~1 minute de données d'entraînement pour une fidélité supérieure. 3. **Support multilingue** — Inférence dans des langues différentes du jeu de données d'entraînement, prenant en charge l'anglais, le japonais, le coréen, le cantonais et le chinois. 4. **Outils WebUI** — Pipeline intégré incluant : - Séparation voix/accompagnement via UVR5 - Segmentation automatique du jeu de données d'entraînement - RSA multilingue via Fun-ASR-Nano, SenseVoice ou FunASR classique - Étiquetage de texte pour la création de jeu de données ## Versions - **v2** : Ajout du support coréen et cantonais, expansion des modèles pré-entraînés de 2k à 5k heures, amélioration de la qualité de synthèse pour les audio de référence de faible qualité. - **v3** : Similarité timbrale accrue avec moins de données d'entraînement, génération GPT plus stable avec moins de répétitions/omissions, expression émotionnelle plus riche. - **v4** : Correction des artefacts métalliques dus au redimensionnement non entier dans v3 ; sortie native en audio 48k au lieu de 24k. - **v2Pro** : Performances équivalentes à v4 avec des exigences matérielles de niveau v2. ## Installation Les plateformes prises en charge incluent Windows, Linux (CUDA/ROCm), macOS (MPS/CPU) et Docker. - Les utilisateurs Windows peuvent télécharger un [pack intégré](https://huggingface.co/lj1995/GPT-SoVITS-windows-package) et exécuter `go-webui.bat`. - Installation Conda : `conda create -n GPTSoVits python=3.10 && conda activate GPTSoVits && bash install.sh` - Des images Docker sont disponibles sur Docker Hub. - Des notebooks Colab sont fournis pour l'entraînement cloud. ## Modèles pré-entraînés Les modèles sont téléchargés depuis Hugging Face et placés dans `GPT_SoVITS/pretrained_models`. Des modèles supplémentaires sont nécessaires pour G2PW (frontend texte chinois), UVR5 (séparation vocale) et les backends RSA (FunASR, Faster Whisper). ## Format des données Les fichiers d'annotation utilisent le format : ``` chemin_vocal|nom_speaker|langue|texte ``` Codes langue : `zh` (chinois), `ja` (japonais), `en` (anglais), `ko` (coréen), `yue` (cantonnais). ## Utilisation - Lancer WebUI : `python webui.py` ou `python GPT_SoVITS/inference_webui.py` - Utilisateurs du pack intégré : double-cliquez sur `go-webui.bat` / `go-webui-v2.bat` - Des outils en ligne de commande sont disponibles pour le traitement UVR5, la segmentation audio et la transcription RSA. ## Vitesse d'inférence Mesures RTF pour GPT-SoVITS v2 ProPlus : 0,028 sur RTX 4060 Ti, 0,014 sur RTX 4090, 0,526 sur CPU Apple M4. Une démo en ligne est disponible sur Hugging Face Spaces. ## Crédits Construit sur la base des recherches de VITS, SoundStorm, HiFi-GAN, BigVGAN et d'autres projets open-source de synthèse vocale. Les outils WebUI incluent UVR5, audio-slicer, FFmpeg, Gradio et FunASR. ## Licence Licence MIT.