Sobre el proyecto

Real-Time Voice Cloning es una implementación del artículo "Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis" (SV2TTS), desarrollada originalmente como tesis de maestría. Clona una voz a partir de unos segundos de audio y luego genera habla arbitraria en tiempo real. SV2TTS es un marco de aprendizaje profundo en tres etapas. La primera etapa crea una representación digital de una voz a partir de unos segundos de audio (un codificador de hablante basado en GE2E). En la segunda y tercera etapas, esa representación se usa como referencia para sintetizar habla para texto arbitrario, usando un sintetizador basado en Tacotron y un vocoder WaveRNN. El repositorio implementa SV2TTS y el propio codificador GE2E, y se basa en fatchord/WaveRNN para los componentes de vocoder y sintetizador. El proyecto proporciona una caja de herramientas con una GUI (demo_toolbox.py) y una interfaz de línea de comandos (demo_cli.py). Se admiten Windows y Linux. La configuración requiere ffmpeg para leer archivos de audio y uv para la gestión de paquetes de Python; la caja de herramientas se puede ejecutar con un extra de CUDA para GPU NVIDIA o un extra de CPU. Los modelos preentrenados se descargan automáticamente, con descargas manuales disponibles desde Hugging Face. Se pueden usar conjuntos de datos opcionales como LibriSpeech train-clean-100 para experimentación, aunque los usuarios pueden en su lugar proporcionar sus propios archivos de audio o grabar directamente en la caja de herramientas. El README señala que el repositorio ha envejecido y que muchos servicios SaaS de pago ahora ofrecen mejor calidad de audio. Remite a los lectores a Papers with Code para investigación reciente en síntesis de voz y a Chatterbox como una alternativa de código abierto más actual.