Sobre el proyecto
Pocket TTS es una aplicación de texto a voz (TTS) de código abierto desarrollada por Kyutai Labs, diseñada para ejecutarse eficientemente en CPUs sin requerir GPUs ni APIs web. El modelo tiene aproximadamente 100 millones de parámetros y está optimizado para la generación de audio de baja latencia, logrando alrededor de 200 ms hasta el primer fragmento de audio y aproximadamente 6 veces la velocidad en tiempo real en una MacBook Air M4 usando solo 2 núcleos de CPU.
El proyecto soporta Python 3.10 hasta 3.14 y requiere PyTorch 2.5 o posterior (se admiten compilaciones solo para CPU). Proporciona tanto una API de biblioteca de Python como una interfaz de línea de comandos (CLI) con comandos para generar audio (`generate`), ejecutar un servidor HTTP local (`serve`) y exportar incrustaciones de voz a archivos safetensors (`export-voice`).
Las características clave incluyen:
- Clonación de voz a partir de muestras de audio (archivos wav o mp3)
- Soporte multilingüe para inglés, francés, alemán, portugués, italiano y español
- Transmisión de audio con soporte para entradas de texto infinitamente largas
- Catálogo de voces preconstruidas con varias voces disponibles en Hugging Face
- Modelos entrenados por la comunidad para idiomas adicionales, incluidos checo, hindi, coreano, persa, indonesio y estonio
- Código de entrenamiento publicado para que los usuarios entrenen sus propios modelos
El proyecto también cuenta con numerosas implementaciones e integraciones de la comunidad, incluidas versiones para WebAssembly/navegador, puertos de Rust, implementaciones en C++, backend MLX para Apple Silicon e integraciones con plataformas como Home Assistant, Discord, Unity y ComfyUI.
El README señala que el soporte de GPU no está oficialmente respaldado, pero se puede lograr moviendo manualmente el modelo a CUDA, con aceleraciones medidas en ciertas configuraciones de hardware.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.