Sobre o projeto

MockingBird é um projeto open-source de clonagem de voz e síntese de fala construído em PyTorch. É um fork do Real-Time-Voice-Cloning, que suportava apenas inglês, e o estende com suporte a mandarim testado em vários conjuntos de dados, como aidatatang_200zh, magicdata, aishell3 e data_aishell. Principais capacidades descritas no README: - Clonagem de voz e geração de fala em tempo real, com o objetivo declarado de clonar uma voz a partir de uma amostra curta. - Suporte a chinês mandarim, testado com vários conjuntos de dados públicos. - Funciona em Windows e Linux, e inclui instruções alternativas para macOS M1. - Um modo de servidor web (web.py) para chamadas remotas, uma caixa de ferramentas GUI (demo_toolbox.py) e um gerador por linha de comando (gen_voice.py). - Pipelines de treino para encoder, sintetizador e vocoder, além de opções para reutilizar encoder/vocoder pré-treinados e modelos de sintetizador compartilhados pela comunidade. - Documentação de problemas comuns, como limites de VRAM, ajuste do tamanho do lote, layout do conjunto de dados e expectativas de progresso do treino. O README observa que o repositório não é mais atualizado ativamente pelo autor, que aponta para um serviço separado hospedado na nuvem. É distribuído sob a licença MIT. O projeto faz referência a vários artigos e implementações de pesquisa, incluindo SV2TTS, GlobalStyleToken, HiFi-GAN, Fre-GAN, WaveRNN, Tacotron e GE2E.