Sobre el proyecto
VoiceStudio es una alternativa de código abierto y totalmente local a los servicios de voz en la nube, que abarca clonación de voz, diseño de voz, doblaje de vídeo, dictado, transcripción y creación de audiolibros. El proyecto anuncia compatibilidad con 646 idiomas y posiciona los flujos de trabajo locales como ejecutados en el hardware del propio usuario, con servicios remotos opcionales y analíticas de uso que requieren consentimiento.
Las capacidades principales se agrupan en tres áreas. Crear: clonar una voz a partir de una grabación de referencia o diseñar una nueva voz a partir de una descripción. Producir: doblar vídeos con habla sincronizada, generar historias y audiolibros, y ejecutar trabajos por lotes. Conectar: exponer una API local y un servidor MCP para agentes, con workers remotos opcionales.
El motor predeterminado es VoiceStudio, descrito como impulsado por k2-fsa/OmniVoice, y se pueden seleccionar otros motores; en la documentación se ofrece un catálogo de funciones y motores. Los requisitos de hardware varían según el motor, y un documento de rendimiento cubre las expectativas. Los modelos se descargan bajo demanda, y la aplicación avisa antes de instalar los modelos necesarios.
Las opciones de instalación incluyen un instalador de un solo comando para macOS y Linux mediante un script curl, que permite instalar la última versión de Electron, una versión específica, compilar la rama main actual o desinstalar conservando los datos. Las descargas de versiones requieren curl y una herramienta SHA-256; compilar main requiere Git, Node.js 22+, Bun, Rust/Cargo y herramientas de compilación de la plataforma. Existen guías de plataforma para macOS, Windows, Linux y Docker, y las versiones pueden descargarse directamente. También hay un prompt de instalación orientado a agentes para agentes de programación como Claude Code, Codex y Cursor, además de una guía para agentes que cubre la detección de hardware, la reutilización de datos existentes, preguntar antes de descargar modelos y una generación de prueba. Se pueden añadir skills con npx skills add debpalash/VoiceStudio, eligiendo entre la skill de flujo de trabajo de audio o la skill de mantenedor.
La ejecución desde el código fuente usa Bun: clonar el repositorio, ejecutar bun install, bun run setup:api para preparar las dependencias de Python y luego bun run dev. Un comando de prueba de humo compila y lanza una app Electron empaquetada aislada, con una comprobación opcional de instalación de runtime gestionado en red.
El README indica que Electron es la única app de escritorio mantenida y que la versión 0.5.3 fue la última release de Tauri; los usuarios existentes de Tauri son dirigidos a un documento de migración, y el código fuente de Tauri queda archivado sin más actualizaciones. Los comandos de desarrollo, compilación, prueba y release en la raíz están orientados a Electron.
La documentación cubre solución de problemas, descargas de modelos, guías de motores, benchmarks, la API de la plataforma de voz local, integración y ejemplos de MCP, además de contribución, configuración de Electron y un changelog. El proyecto tiene licencia AGPL-3.0, con un aviso aparte que cubre las licencias de los modelos y el uso responsable; el README aconseja revisar las licencias de los modelos antes de un uso comercial y clonar voces solo con permiso. Se enumeran canales de patrocinio y donación.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.