Sobre o projeto
O Voicebox é um estúdio de voz com IA de código aberto projetado para ser executado localmente na própria máquina do usuário, posicionando-se como uma alternativa gratuita a serviços em nuvem como ElevenLabs e WisprFlow. Ele abrange tanto a saída de voz (conversão de texto em fala e clonagem de voz) quanto a entrada de voz (ditado por reconhecimento de fala), com um LLM local incluído para refinamento opcional e personalidades de voz por perfil.
Principais capacidades descritas no repositório:
- **Clonagem de voz e TTS**: clonagem zero-shot a partir de uma curta amostra de referência, além de mais de 50 vozes predefinidas selecionadas. Sete mecanismos de TTS estão incluídos (Qwen3-TTS, Qwen CustomVoice, LuxTTS, Chatterbox Multilingual, Chatterbox Turbo, HumeAI TADA e Kokoro), cobrindo até 23 idiomas, dependendo do mecanismo.
- **Reconhecimento de fala**: alimentado localmente pelo OpenAI Whisper, com opções de modelo desde Base até Turbo, executado via MLX em Apple Silicon ou PyTorch em CUDA/ROCm/DirectML/CPU.
- **Ditado global**: uma tecla de atalho em todo o sistema permite que os usuários ditem em qualquer campo de texto com foco. O README observa colagem com reconhecimento de destino e injeção verificada por acessibilidade no macOS, além de experiência de permissões na primeira execução para Acessibilidade e Monitoramento de Entrada.
- **Pós-processamento de áudio**: oito efeitos construídos sobre a biblioteca pedalboard do Spotify, incluindo alteração de tom, reverb, delay, chorus, compressor, ganho e filtros, com presets reutilizáveis.
- **Saída de voz para agentes**: um servidor MCP (Model Context Protocol) integrado expõe ferramentas como `voicebox.speak`, `voicebox.transcribe`, `voicebox.list_captures` e `voicebox.list_profiles`. Agentes compatíveis com MCP, como Claude Code, Cursor, Windsurf e Cline, podem falar com o usuário usando uma voz clonada por meio de uma única chamada de ferramenta.
- **Privacidade local**: modelos, dados de voz e capturas permanecem na máquina do usuário.
- **Editor de histórias**: uma linha do tempo multifaixa para conversas, podcasts e narrativas, com composição por arrastar e soltar e reprodução sincronizada.
- **Capturas**: ditados, gravações no aplicativo e uploads são mantidos com áudio e transcrição, podendo ser retranscritos, refinados, editados ou promovidos para amostras de voz.
- **API**: uma API REST está disponível em `http://127.0.0.1:17493` para `/generate`, `/speak`, `/transcribe` e `/profiles`, com documentação em `/docs`.
- **Plataformas**: downloads prontos para macOS (Apple Silicon e Intel) e Windows, além de suporte a Docker e instruções para compilação a partir do código-fonte no Linux.
Tecnicamente, o aplicativo desktop é construído com Tauri (Rust) e React/TypeScript, com backend Python FastAPI, armazenamento SQLite e inferência via MLX ou PyTorch, dependendo da plataforma e da GPU. O roteiro no README menciona trabalho futuro em colagem automática para Windows/Linux, mecanismos adicionais de STT, transcrição em streaming, LLMs de fala ponta a ponta e arquitetura de plugins. O projeto está disponível no GitHub sob uma licença indicada no README, e as diretrizes de contribuição estão incluídas no repositório.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.