Sobre o projeto

Pocket TTS é uma aplicação de conversão de texto em fala (TTS) de código aberto desenvolvida pela Kyutai Labs, projetada para rodar com eficiência em CPUs sem exigir GPUs ou APIs web. O modelo tem aproximadamente 100 milhões de parâmetros e é otimizado para geração de áudio com baixa latência, alcançando cerca de 200 ms até o primeiro trecho de áudio e aproximadamente 6x a velocidade em tempo real em um MacBook Air M4 usando apenas 2 núcleos de CPU. O projeto suporta Python 3.10 a 3.14 e requer PyTorch 2.5 ou posterior (versões somente CPU são suportadas). Ele fornece tanto uma API de biblioteca Python quanto uma interface de linha de comando (CLI) com comandos para gerar áudio (`generate`), executar um servidor HTTP local (`serve`) e exportar embeddings de voz para arquivos safetensors (`export-voice`). Os principais recursos incluem: - Clonagem de voz a partir de amostras de áudio (arquivos wav ou mp3) - Suporte multilíngue para inglês, francês, alemão, português, italiano e espanhol - Streaming de áudio com suporte para entradas de texto infinitamente longas - Catálogo de vozes pré-construído com várias vozes disponíveis no Hugging Face - Modelos treinados pela comunidade para idiomas adicionais, incluindo tcheco, hindi, coreano, persa, indonésio e estoniano - Código de treinamento lançado para que usuários treinem seus próprios modelos O projeto também possui diversas implementações e integrações da comunidade, incluindo versões WebAssembly/navegador, ports em Rust, implementações em C++, backend MLX para Apple Silicon e integrações com plataformas como Home Assistant, Discord, Unity e ComfyUI. O README observa que o suporte a GPU não é oficialmente suportado, mas pode ser obtido movendo manualmente o modelo para CUDA, com acelerações medidas em certas configurações de hardware.