Sobre el proyecto

Pocket TTS es una aplicación de texto a voz (TTS) de código abierto desarrollada por Kyutai Labs, diseñada para ejecutarse eficientemente en CPUs sin requerir GPUs ni APIs web. El modelo tiene aproximadamente 100 millones de parámetros y está optimizado para la generación de audio de baja latencia, logrando alrededor de 200 ms hasta el primer fragmento de audio y aproximadamente 6 veces la velocidad en tiempo real en una MacBook Air M4 usando solo 2 núcleos de CPU. El proyecto soporta Python 3.10 hasta 3.14 y requiere PyTorch 2.5 o posterior (se admiten compilaciones solo para CPU). Proporciona tanto una API de biblioteca de Python como una interfaz de línea de comandos (CLI) con comandos para generar audio (`generate`), ejecutar un servidor HTTP local (`serve`) y exportar incrustaciones de voz a archivos safetensors (`export-voice`). Las características clave incluyen: - Clonación de voz a partir de muestras de audio (archivos wav o mp3) - Soporte multilingüe para inglés, francés, alemán, portugués, italiano y español - Transmisión de audio con soporte para entradas de texto infinitamente largas - Catálogo de voces preconstruidas con varias voces disponibles en Hugging Face - Modelos entrenados por la comunidad para idiomas adicionales, incluidos checo, hindi, coreano, persa, indonesio y estonio - Código de entrenamiento publicado para que los usuarios entrenen sus propios modelos El proyecto también cuenta con numerosas implementaciones e integraciones de la comunidad, incluidas versiones para WebAssembly/navegador, puertos de Rust, implementaciones en C++, backend MLX para Apple Silicon e integraciones con plataformas como Home Assistant, Discord, Unity y ComfyUI. El README señala que el soporte de GPU no está oficialmente respaldado, pero se puede lograr moviendo manualmente el modelo a CUDA, con aceleraciones medidas en ciertas configuraciones de hardware.