Sobre o projeto
MockingBird é um projeto open-source de clonagem de voz e síntese de fala construído em PyTorch. É um fork do Real-Time-Voice-Cloning, que suportava apenas inglês, e o estende com suporte a mandarim testado em vários conjuntos de dados, como aidatatang_200zh, magicdata, aishell3 e data_aishell.
Principais capacidades descritas no README:
- Clonagem de voz e geração de fala em tempo real, com o objetivo declarado de clonar uma voz a partir de uma amostra curta.
- Suporte a chinês mandarim, testado com vários conjuntos de dados públicos.
- Funciona em Windows e Linux, e inclui instruções alternativas para macOS M1.
- Um modo de servidor web (web.py) para chamadas remotas, uma caixa de ferramentas GUI (demo_toolbox.py) e um gerador por linha de comando (gen_voice.py).
- Pipelines de treino para encoder, sintetizador e vocoder, além de opções para reutilizar encoder/vocoder pré-treinados e modelos de sintetizador compartilhados pela comunidade.
- Documentação de problemas comuns, como limites de VRAM, ajuste do tamanho do lote, layout do conjunto de dados e expectativas de progresso do treino.
O README observa que o repositório não é mais atualizado ativamente pelo autor, que aponta para um serviço separado hospedado na nuvem. É distribuído sob a licença MIT. O projeto faz referência a vários artigos e implementações de pesquisa, incluindo SV2TTS, GlobalStyleToken, HiFi-GAN, Fre-GAN, WaveRNN, Tacotron e GE2E.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.