Sobre el proyecto
Voicebox es un estudio de voz de IA de código abierto diseñado para ejecutarse localmente en tu propia máquina, presentándose como una alternativa gratuita a servicios en la nube como ElevenLabs y WisprFlow. Cubre tanto la salida de voz (texto a voz y clonación de voz) como la entrada de voz (dictado de voz a texto), con un LLM local incluido para refinamiento opcional y personalidades de voz por perfil.
Capacidades clave descritas en el repositorio:
- **Clonación de voz y TTS**: Clonación zero-shot a partir de una muestra de referencia corta, además de más de 50 voces predefinidas seleccionadas. Incluye siete motores TTS (Qwen3-TTS, Qwen CustomVoice, LuxTTS, Chatterbox Multilingual, Chatterbox Turbo, HumeAI TADA y Kokoro), que cubren hasta 23 idiomas según el motor.
- **Voz a texto**: Impulsado por OpenAI Whisper localmente, con opciones de tamaño de modelo desde Base hasta Turbo, ejecutándose mediante MLX en Apple Silicon o PyTorch en CUDA/ROCm/DirectML/CPU.
- **Dictado global**: Una tecla rápida a nivel de sistema permite a los usuarios dictar en cualquier campo de texto enfocado. El README señala pegado consciente del destino con inyección verificada por accesibilidad en macOS y experiencia de permisos de primer uso para Accesibilidad y Monitoreo de Entrada.
- **Postprocesamiento de audio**: Ocho efectos construidos sobre la biblioteca pedalboard de Spotify, incluyendo cambio de tono, reverberación, retardo, coro, compresor, ganancia y filtros, con presets reutilizables.
- **Salida de voz para agentes**: Un servidor MCP (Model Context Protocol) integrado expone herramientas como `voicebox.speak`, `voicebox.transcribe`, `voicebox.list_captures` y `voicebox.list_profiles`. Agentes compatibles con MCP como Claude Code, Cursor, Windsurf y Cline pueden hablar al usuario con una voz clonada mediante una sola llamada de herramienta.
- **Privacidad local**: Los modelos, los datos de voz y las capturas permanecen en la máquina del usuario.
- **Editor de historias**: Una línea de tiempo multipista para conversaciones, podcasts y narrativas, con composición mediante arrastrar y soltar y reproducción sincronizada.
- **Capturas**: Los dictados, grabaciones dentro de la aplicación y cargas se conservan con audio y transcripción, y pueden volver a transcribirse, refinarse, editarse o promoverse a muestras de voz.
- **API**: Hay una API REST disponible en `http://127.0.0.1:17493` para `/generate`, `/speak`, `/transcribe` y `/profiles`, con documentación en `/docs`.
- **Plataformas**: Descargas listas para macOS (Apple Silicon e Intel) y Windows, además de soporte para Docker e instrucciones de compilación desde el código fuente para Linux.
Técnicamente, la aplicación de escritorio está construida con Tauri (Rust) y React/TypeScript, con un backend en Python usando FastAPI, almacenamiento SQLite e inferencia mediante MLX o PyTorch según la plataforma y la GPU. La hoja de ruta en el README menciona trabajo futuro en pegado automático para Windows/Linux, motores STT adicionales, transcripción en streaming, LLM de voz de extremo a extremo y arquitectura de plugins. El proyecto está disponible en GitHub bajo una insignia de licencia señalada en el README, y las directrices de contribución están incluidas en el repositorio.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.