Sobre o projeto

VoiceStudio é uma alternativa open-source e totalmente local aos serviços de voz em nuvem, cobrindo clonagem de voz, design de voz, dublagem de vídeo, ditado, transcrição e criação de audiolivros. O projeto anuncia suporte a 646 idiomas e posiciona fluxos de trabalho locais como executados no hardware do próprio usuário, com serviços remotos opcionais e análises de uso exigindo consentimento. As capacidades principais são agrupadas em três áreas. Criar: clone uma voz a partir de uma gravação de referência ou crie uma nova voz a partir de uma descrição. Produzir: duble vídeos com fala sincronizada, gere histórias e audiolivros e execute trabalhos em lote. Conectar: exponha uma API local e um servidor MCP para agentes, com trabalhadores remotos opcionais. O mecanismo padrão é o VoiceStudio, descrito como alimentado por k2-fsa/OmniVoice, e outros mecanismos podem ser selecionados; um catálogo de recursos e mecanismos é fornecido na documentação. Os requisitos de hardware variam por mecanismo, e um documento de desempenho cobre as expectativas. Os modelos são baixados sob demanda, e o aplicativo solicita permissão antes de instalar os modelos necessários. As opções de instalação incluem um instalador de comando único para macOS e Linux via script curl, que suporta instalar a versão mais recente do Electron, uma versão específica, compilar o main atual ou desinstalar mantendo os dados. Os downloads de versões exigem curl e uma ferramenta SHA-256; compilar o main exige Git, Node.js 22+, Bun, Rust/Cargo e ferramentas de build da plataforma. Existem guias de plataforma para macOS, Windows, Linux e Docker, e as versões podem ser baixadas diretamente. Há também um prompt de instalação orientado a agentes para agentes de codificação como Claude Code, Codex e Cursor, além de um guia de agente cobrindo detecção de hardware, reutilização de dados existentes, solicitação antes de downloads de modelos e uma geração de teste. Habilidades podem ser adicionadas com npx skills add debpalash/VoiceStudio, escolhendo a habilidade de fluxo de trabalho de áudio ou a habilidade de mantenedor. Executar a partir do código-fonte usa Bun: clone o repositório, execute bun install, bun run setup:api para preparar dependências Python e depois bun run dev. Um comando de teste de fumaça compila e inicia um aplicativo Electron empacotado isolado, com uma verificação opcional de instalação de runtime gerenciado em rede. O README afirma que o Electron é o único aplicativo desktop mantido e que a versão 0.5.3 foi a versão final do Tauri; usuários existentes do Tauri são direcionados a um documento de migração, e o código-fonte do Tauri está arquivado sem atualizações futuras. Os comandos de desenvolvimento, build, teste e release visam o Electron. A documentação cobre solução de problemas, downloads de modelos, guias de mecanismos, benchmarks, a API da plataforma de fala local, integração MCP e exemplos, além de contribuição, configuração do Electron e um changelog. O projeto é licenciado sob AGPL-3.0, com um aviso separado cobrindo licenças de modelos e uso responsável; o README aconselha revisar as licenças de modelos antes do uso comercial e clonar vozes apenas com permissão. Canais de patrocínio e doação são listados.