À propos du projet
Voicebox est un studio vocal IA open source conçu pour fonctionner localement sur votre propre machine, se positionnant comme une alternative gratuite aux services cloud tels qu'ElevenLabs et WisprFlow. Il couvre à la fois la sortie vocale (synthèse vocale et clonage de voix) et l'entrée vocale (dictée par reconnaissance vocale), avec un LLM local inclus pour un raffinement optionnel et des personnalités vocales par profil.
Principales capacités décrites dans le dépôt :
- **Clonage vocal et TTS** : clonage zero-shot à partir d'un court échantillon de référence, plus de 50 voix prédéfinies sélectionnées. Sept moteurs TTS sont inclus (Qwen3-TTS, Qwen CustomVoice, LuxTTS, Chatterbox Multilingual, Chatterbox Turbo, HumeAI TADA et Kokoro), couvrant jusqu'à 23 langues selon le moteur.
- **Reconnaissance vocale** : propulsée par OpenAI Whisper en local, avec des options de taille de modèle allant de Base à Turbo, fonctionnant via MLX sur Apple Silicon ou PyTorch sur CUDA/ROCm/DirectML/CPU.
- **Dictée globale** : un raccourci clavier système permet aux utilisateurs de dicter dans n'importe quel champ de texte actif. Le README mentionne un collage adapté à la cible avec une injection vérifiée par accessibilité sur macOS et une expérience utilisateur de permissions au premier lancement pour l'accessibilité et la surveillance des entrées.
- **Post-traitement audio** : huit effets construits sur la bibliothèque pedalboard de Spotify, incluant le décalage de hauteur, la réverbération, le délai, le chorus, le compresseur, le gain et les filtres, avec des préréglages réutilisables.
- **Sortie vocale d'agent** : un serveur MCP (Model Context Protocol) intégré expose des outils tels que `voicebox.speak`, `voicebox.transcribe`, `voicebox.list_captures` et `voicebox.list_profiles`. Les agents compatibles MCP comme Claude Code, Cursor, Windsurf et Cline peuvent parler à l'utilisateur avec une voix clonée via un seul appel d'outil.
- **Confidentialité locale** : les modèles, les données vocales et les captures restent sur la machine de l'utilisateur.
- **Éditeur Stories** : une timeline multipiste pour les conversations, podcasts et récits, avec composition par glisser-déposer et lecture synchronisée.
- **Captures** : les dictées, enregistrements dans l'application et téléversements sont conservés avec l'audio et la transcription, et peuvent être retranscrits, affinés, édités ou promus en échantillons vocaux.
- **API** : une API REST est disponible sur `http://127.0.0.1:17493` pour `/generate`, `/speak`, `/transcribe` et `/profiles`, avec documentation sur `/docs`.
- **Plateformes** : téléchargements prêts à l'emploi pour macOS (Apple Silicon et Intel) et Windows, plus prise en charge Docker et instructions de compilation depuis les sources pour Linux.
Techniquement, l'application de bureau est construite avec Tauri (Rust) et React/TypeScript, avec un backend Python FastAPI, un stockage SQLite et une inférence MLX ou PyTorch selon la plateforme et le GPU. La feuille de route du README mentionne des travaux futurs sur le collage automatique Windows/Linux, des moteurs STT supplémentaires, la transcription en streaming, des LLM vocaux de bout en bout et une architecture de plugins. Le projet est disponible sur GitHub sous une licence indiquée dans le README, et des directives de contribution sont incluses dans le dépôt.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.