Sobre o projeto

# GPT-SoVITS Uma poderosa WebUI de conversão de voz few-shot e text-to-speech criada por RVC-Boss. ## Visão Geral O GPT-SoVITS permite clonagem de voz com dados de treinamento mínimos. Uma amostra vocal de 5 segundos suporta TTS zero-shot, enquanto aproximadamente 1 minuto de dados ajusta o modelo para melhor similaridade e realismo vocal. ## Principais Recursos 1. **TTS Zero-shot** — Insira uma amostra vocal de 5 segundos para conversão instantânea de texto para fala. 2. **TTS Few-shot** — Ajuste com ~1 minuto de dados de treinamento para maior fidelidade. 3. **Suporte Multilíngue** — Inferência em idiomas diferentes do dataset de treinamento, suportando inglês, japonês, coreano, cantonês e chinês. 4. **Ferramentas WebUI** — Pipeline integrado incluindo: - Separação de voz/acompanhamento via UVR5 - Segmentação automática do conjunto de treinamento - ASR multilíngue usando Fun-ASR-Nano, SenseVoice ou FunASR clássico - Rótulos de texto para criação de datasets ## Versões - **v2**: Adicionado suporte a coreano e cantonês, modelos pre-treinados expandidos de 2k para 5k horas, melhoria na qualidade de síntese para áudios de referência de baixa qualidade. - **v3**: Maior similaridade de timbre com menos dados de treinamento, geração GPT mais estável com menos repetições/omissões, expressão emocional mais rica. - **v4**: Corrige artefatos metálicos do upsampling não inteiro do v3; saída nativa de áudio 48k ao invés de 24k. - **v2Pro**: Desempenho equivalente ao v4 com requisitos de hardware nível v2. ## Instalação Plataformas suportadas: Windows, Linux (CUDA/ROCm), macOS (MPS/CPU) e Docker. - Usuários do Windows podem baixar o [pacote integrado](https://huggingface.co/lj1995/GPT-SoVITS-windows-package) e executar `go-webui.bat`. - Instalação via Conda: `conda create -n GPTSoVits python=3.10 && conda activate GPTSoVits && bash install.sh` - Imagens Docker disponíveis no Docker Hub. - Notebooks Colab para treinamento na nuvem. ## Modelos Pre-treinados Modelos são baixados do Hugging Face e colocados em `GPT_SoVITS/pretrained_models`. Modelos adicionais são necessários para G2PW (frontend de texto chinês), UVR5 (separação vocal) e backends ASR (FunASR, Faster Whisper). ## Formato do Dataset Arquivos de anotação usam o formato: ``` vocal_path|speaker_name|language|text ``` Códigos de idioma: `zh` (chinês), `ja` (japonês), `en` (inglês), `ko` (coreano), `yue` (cantonês). ## Uso - Iniciar WebUI: `python webui.py` ou `python GPT_SoVITS/inference_webui.py` - Usuários do pacote integrado: clique duas vezes em `go-webui.bat` / `go-webui-v2.bat` - Ferramentas de linha de comando disponíveis para processamento UVR5, segmentação de áudio e transcrição ASR. ## Velocidade de Inferência Benchmark RTF do GPT-SoVITS v2 ProPlus: 0.028 em RTX 4060 Ti, 0.014 em RTX 4090, 0.526 em CPU Apple M4. Demo online disponível no Hugging Face Spaces. ## Créditos Construído com base nas pesquisas de VITS, SoundStorm, HiFi-GAN, BigVGAN e outros projetos open-source de síntese de fala. Ferramentas WebUI incluem UVR5, audio-slicer, FFmpeg, Gradio e FunASR. ## Licença Licença MIT.