Sobre el proyecto

ChatTTS es un modelo de síntesis de voz generativa diseñado específicamente para escenarios de diálogo, como asistentes de LLM. El repositorio proporciona la infraestructura algorítmica, los pesos del modelo preentrenado y ejemplos simples para ejecutar inferencias. Los idiomas soportados son inglés y chino, con otros idiomas listados como próximamente disponibles. El modelo se entrenó en datos de audio en chino e inglés, y la versión de código abierto en HuggingFace se describe como un modelo preentrenado de 40.000 horas sin SFT. Capacidades clave descritas en el README: - TTS conversacional optimizado para tareas basadas en diálogos, con soporte para múltiples hablantes. - Control detallado sobre características prosódicas, incluyendo risas, pausas y interjecciones. - Unidades de control a nivel de token como [risa], [uv_break] y [lbreak], además de control a nivel de oración mediante prompts como [oral_2][risa_0][pausa_6]. - Muestreo de hablantes desde una distribución gaussiana, con la embebida del hablante muestreada guardada para recuperación de timbre posterior. - Parámetros de decodificación ajustables, incluyendo temperatura, top_P y top_K. - Generación de audio en streaming. Opciones para empezar incluyen clonar el repositorio e instalar requisitos mediante pip o conda, instalar el paquete desde PyPI o GitHub, y ejecutar un ejemplo de WebUI o un script de inferencia por línea de comandos. Un ejemplo básico de uso en Python carga el modelo, ejecuta inferencias en una lista de textos y guarda archivos WAV de salida a 24 kHz. Ejemplos avanzados cubren muestreo de hablantes, control a nivel de oración y palabra, y una muestra de presentación personal. El README menciona expectativas de hardware: al menos 4 GB de memoria de GPU para un clip de audio de 30 segundos, y en una GPU 4090 un RTF de alrededor de 0.3. También menciona que los modelos autoregresivos pueden mostrar inestabilidad como salida de múltiples hablantes o mala calidad de audio, y sugiere probar múltiples muestras. Licencia: el código se publica bajo AGPLv3+, mientras que el modelo se publica bajo CC BY-NC 4.0 para uso educativo y de investigación, no comercial ni ilegal. El README indica que se añadió un pequeño ruido de alta frecuencia durante el entrenamiento del modelo de 40.000 horas y la calidad del audio se comprimió usando formato MP3 para limitar el uso indebido, y que se planea liberar un modelo de detección entrenado internamente de forma abierta. El proyecto reconoce trabajos previos incluyendo bark, XTTSv2, valle, fish-speech y vocos, y apunta a un repositorio mantenido por la comunidad, Awesome-ChatTTS, para productos finales extendidos.