Sobre o projeto

O Voicebox é um estúdio de voz com IA de código aberto projetado para ser executado localmente na própria máquina do usuário, posicionando-se como uma alternativa gratuita a serviços em nuvem como ElevenLabs e WisprFlow. Ele abrange tanto a saída de voz (conversão de texto em fala e clonagem de voz) quanto a entrada de voz (ditado por reconhecimento de fala), com um LLM local incluído para refinamento opcional e personalidades de voz por perfil. Principais capacidades descritas no repositório: - **Clonagem de voz e TTS**: clonagem zero-shot a partir de uma curta amostra de referência, além de mais de 50 vozes predefinidas selecionadas. Sete mecanismos de TTS estão incluídos (Qwen3-TTS, Qwen CustomVoice, LuxTTS, Chatterbox Multilingual, Chatterbox Turbo, HumeAI TADA e Kokoro), cobrindo até 23 idiomas, dependendo do mecanismo. - **Reconhecimento de fala**: alimentado localmente pelo OpenAI Whisper, com opções de modelo desde Base até Turbo, executado via MLX em Apple Silicon ou PyTorch em CUDA/ROCm/DirectML/CPU. - **Ditado global**: uma tecla de atalho em todo o sistema permite que os usuários ditem em qualquer campo de texto com foco. O README observa colagem com reconhecimento de destino e injeção verificada por acessibilidade no macOS, além de experiência de permissões na primeira execução para Acessibilidade e Monitoramento de Entrada. - **Pós-processamento de áudio**: oito efeitos construídos sobre a biblioteca pedalboard do Spotify, incluindo alteração de tom, reverb, delay, chorus, compressor, ganho e filtros, com presets reutilizáveis. - **Saída de voz para agentes**: um servidor MCP (Model Context Protocol) integrado expõe ferramentas como `voicebox.speak`, `voicebox.transcribe`, `voicebox.list_captures` e `voicebox.list_profiles`. Agentes compatíveis com MCP, como Claude Code, Cursor, Windsurf e Cline, podem falar com o usuário usando uma voz clonada por meio de uma única chamada de ferramenta. - **Privacidade local**: modelos, dados de voz e capturas permanecem na máquina do usuário. - **Editor de histórias**: uma linha do tempo multifaixa para conversas, podcasts e narrativas, com composição por arrastar e soltar e reprodução sincronizada. - **Capturas**: ditados, gravações no aplicativo e uploads são mantidos com áudio e transcrição, podendo ser retranscritos, refinados, editados ou promovidos para amostras de voz. - **API**: uma API REST está disponível em `http://127.0.0.1:17493` para `/generate`, `/speak`, `/transcribe` e `/profiles`, com documentação em `/docs`. - **Plataformas**: downloads prontos para macOS (Apple Silicon e Intel) e Windows, além de suporte a Docker e instruções para compilação a partir do código-fonte no Linux. Tecnicamente, o aplicativo desktop é construído com Tauri (Rust) e React/TypeScript, com backend Python FastAPI, armazenamento SQLite e inferência via MLX ou PyTorch, dependendo da plataforma e da GPU. O roteiro no README menciona trabalho futuro em colagem automática para Windows/Linux, mecanismos adicionais de STT, transcrição em streaming, LLMs de fala ponta a ponta e arquitetura de plugins. O projeto está disponível no GitHub sob uma licença indicada no README, e as diretrizes de contribuição estão incluídas no repositório.