Sobre el proyecto
MockingBird es un proyecto de código abierto de clonación de voz y síntesis de texto a voz construido sobre PyTorch. Es una bifurcación de Real-Time-Voice-Cloning, que solo soportaba inglés, y lo extiende con soporte para chino mandarín, probado en varios conjuntos de datos como aidatatang_200zh, magicdata, aishell3 y data_aishell.
Las principales capacidades descritas en el README:
- Clonación de voz y generación de habla en tiempo real, con el objetivo declarado de clonar una voz a partir de una muestra corta.
- Soporte para chino mandarín, probado con múltiples conjuntos de datos públicos.
- Funciona en Windows y Linux, e incluye instrucciones de solución de problemas para macOS con M1.
- Un modo de servidor web (web.py) para llamadas remotas, una interfaz gráfica (demo_toolbox.py) y un generador por línea de comandos (gen_voice.py).
- Pipelines de entrenamiento para codificador, sintetizador y vocoder, además de opciones para reutilizar codificador/vocoder preentrenados y modelos de sintetizador compartidos por la comunidad.
- Documentación de problemas comunes como límites de VRAM, ajuste del tamaño de lote, distribución de datos y expectativas de progreso del entrenamiento.
El README señala que el repositorio ya no es actualizado activamente por el autor, quien apunta a un servicio alojado en la nube por separado. Se publica bajo la licencia MIT. El proyecto referencia varios artículos de investigación e implementaciones, incluyendo SV2TTS, GlobalStyleToken, HiFi-GAN, Fre-GAN, WaveRNN, Tacotron y GE2E.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.