Sobre el proyecto

MockingBird es un proyecto de código abierto de clonación de voz y síntesis de texto a voz construido sobre PyTorch. Es una bifurcación de Real-Time-Voice-Cloning, que solo soportaba inglés, y lo extiende con soporte para chino mandarín, probado en varios conjuntos de datos como aidatatang_200zh, magicdata, aishell3 y data_aishell. Las principales capacidades descritas en el README: - Clonación de voz y generación de habla en tiempo real, con el objetivo declarado de clonar una voz a partir de una muestra corta. - Soporte para chino mandarín, probado con múltiples conjuntos de datos públicos. - Funciona en Windows y Linux, e incluye instrucciones de solución de problemas para macOS con M1. - Un modo de servidor web (web.py) para llamadas remotas, una interfaz gráfica (demo_toolbox.py) y un generador por línea de comandos (gen_voice.py). - Pipelines de entrenamiento para codificador, sintetizador y vocoder, además de opciones para reutilizar codificador/vocoder preentrenados y modelos de sintetizador compartidos por la comunidad. - Documentación de problemas comunes como límites de VRAM, ajuste del tamaño de lote, distribución de datos y expectativas de progreso del entrenamiento. El README señala que el repositorio ya no es actualizado activamente por el autor, quien apunta a un servicio alojado en la nube por separado. Se publica bajo la licencia MIT. El proyecto referencia varios artículos de investigación e implementaciones, incluyendo SV2TTS, GlobalStyleToken, HiFi-GAN, Fre-GAN, WaveRNN, Tacotron y GE2E.