Sobre o projeto
# GPT-SoVITS
Uma poderosa WebUI de conversão de voz few-shot e text-to-speech criada por RVC-Boss.
## Visão Geral
O GPT-SoVITS permite clonagem de voz com dados de treinamento mínimos. Uma amostra vocal de 5 segundos suporta TTS zero-shot, enquanto aproximadamente 1 minuto de dados ajusta o modelo para melhor similaridade e realismo vocal.
## Principais Recursos
1. **TTS Zero-shot** — Insira uma amostra vocal de 5 segundos para conversão instantânea de texto para fala.
2. **TTS Few-shot** — Ajuste com ~1 minuto de dados de treinamento para maior fidelidade.
3. **Suporte Multilíngue** — Inferência em idiomas diferentes do dataset de treinamento, suportando inglês, japonês, coreano, cantonês e chinês.
4. **Ferramentas WebUI** — Pipeline integrado incluindo:
- Separação de voz/acompanhamento via UVR5
- Segmentação automática do conjunto de treinamento
- ASR multilíngue usando Fun-ASR-Nano, SenseVoice ou FunASR clássico
- Rótulos de texto para criação de datasets
## Versões
- **v2**: Adicionado suporte a coreano e cantonês, modelos pre-treinados expandidos de 2k para 5k horas, melhoria na qualidade de síntese para áudios de referência de baixa qualidade.
- **v3**: Maior similaridade de timbre com menos dados de treinamento, geração GPT mais estável com menos repetições/omissões, expressão emocional mais rica.
- **v4**: Corrige artefatos metálicos do upsampling não inteiro do v3; saída nativa de áudio 48k ao invés de 24k.
- **v2Pro**: Desempenho equivalente ao v4 com requisitos de hardware nível v2.
## Instalação
Plataformas suportadas: Windows, Linux (CUDA/ROCm), macOS (MPS/CPU) e Docker.
- Usuários do Windows podem baixar o [pacote integrado](https://huggingface.co/lj1995/GPT-SoVITS-windows-package) e executar `go-webui.bat`.
- Instalação via Conda: `conda create -n GPTSoVits python=3.10 && conda activate GPTSoVits && bash install.sh`
- Imagens Docker disponíveis no Docker Hub.
- Notebooks Colab para treinamento na nuvem.
## Modelos Pre-treinados
Modelos são baixados do Hugging Face e colocados em `GPT_SoVITS/pretrained_models`. Modelos adicionais são necessários para G2PW (frontend de texto chinês), UVR5 (separação vocal) e backends ASR (FunASR, Faster Whisper).
## Formato do Dataset
Arquivos de anotação usam o formato:
```
vocal_path|speaker_name|language|text
```
Códigos de idioma: `zh` (chinês), `ja` (japonês), `en` (inglês), `ko` (coreano), `yue` (cantonês).
## Uso
- Iniciar WebUI: `python webui.py` ou `python GPT_SoVITS/inference_webui.py`
- Usuários do pacote integrado: clique duas vezes em `go-webui.bat` / `go-webui-v2.bat`
- Ferramentas de linha de comando disponíveis para processamento UVR5, segmentação de áudio e transcrição ASR.
## Velocidade de Inferência
Benchmark RTF do GPT-SoVITS v2 ProPlus: 0.028 em RTX 4060 Ti, 0.014 em RTX 4090, 0.526 em CPU Apple M4. Demo online disponível no Hugging Face Spaces.
## Créditos
Construído com base nas pesquisas de VITS, SoundStorm, HiFi-GAN, BigVGAN e outros projetos open-source de síntese de fala. Ferramentas WebUI incluem UVR5, audio-slicer, FFmpeg, Gradio e FunASR.
## Licença
Licença MIT.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.