Sobre o projeto
Real-Time Voice Cloning é uma implementação do artigo "Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis" (SV2TTS), originalmente desenvolvido como tese de mestrado. Ele clona uma voz a partir de alguns segundos de áudio e gera fala arbitrária em tempo real.
SV2TTS é um framework de aprendizado profundo em três estágios. O primeiro estágio cria uma representação digital de uma voz a partir de alguns segundos de áudio (um codificador de locutor baseado em GE2E). No segundo e terceiro estágios, essa representação é usada como referência para sintetizar fala para texto arbitrário, usando um sintetizador baseado em Tacotron e um vocoder WaveRNN. O repositório implementa o SV2TTS e o codificador GE2E em si, e se baseia em fatchord/WaveRNN para os componentes de vocoder e sintetizador.
O projeto fornece uma toolbox com GUI (demo_toolbox.py) e interface de linha de comando (demo_cli.py). Windows e Linux são suportados. A configuração requer ffmpeg para ler arquivos de áudio e uv para gerenciamento de pacotes Python; a toolbox pode ser executada com um extra CUDA para GPUs NVIDIA ou um extra CPU. Modelos pré-treinados são baixados automaticamente, com downloads manuais disponíveis no Hugging Face. Conjuntos de dados opcionais, como LibriSpeech train-clean-100, podem ser usados para experimentação, embora os usuários possam fornecer seus próprios arquivos de áudio ou gravar diretamente na toolbox.
O README observa que o repositório envelheceu e que muitos serviços SaaS pagos agora oferecem melhor qualidade de áudio. Ele aponta os leitores para Papers with Code para pesquisas recentes em síntese de fala e para Chatterbox como uma alternativa open-source mais atual.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.