À propos du projet
VoiceStudio est une alternative open source et entièrement locale aux services vocaux cloud, couvrant le clonage vocal, la conception de voix, le doublage vidéo, la dictée, la transcription et la création de livres audio. Le projet annonce la prise en charge de 646 langues et présente les flux de travail locaux comme s'exécutant sur le matériel de l'utilisateur, les services distants étant optionnels et les analyses d'utilisation nécessitant le consentement.
Les capacités principales sont regroupées en trois domaines. Créer : cloner une voix à partir d'un enregistrement de référence ou concevoir une nouvelle voix à partir d'une description. Produire : doubler des vidéos avec une parole synchronisée, générer des histoires et des livres audio, et exécuter des tâches par lots. Connecter : exposer une API locale et un serveur MCP pour les agents, avec des workers distants optionnels.
Le moteur par défaut est VoiceStudio, décrit comme propulsé par k2-fsa/OmniVoice, et d'autres moteurs peuvent être sélectionnés ; un catalogue de fonctionnalités et de moteurs est fourni dans la documentation. Les exigences matérielles varient selon le moteur, et un document de performance couvre les attentes. Les modèles sont téléchargés à la demande, et l'application demande confirmation avant d'installer les modèles requis.
Les options d'installation incluent un installateur en une commande pour macOS et Linux via un script curl, qui prend en charge l'installation de la dernière version Electron, d'une version spécifique, la compilation de la branche main actuelle, ou la désinstallation tout en conservant les données. Les téléchargements de versions nécessitent curl et un outil SHA-256 ; compiler main nécessite Git, Node.js 22+, Bun, Rust/Cargo et les outils de compilation de la plateforme. Des guides par plateforme existent pour macOS, Windows, Linux et Docker, et les versions peuvent être téléchargées directement. Il existe également une invite d'installation orientée agent pour les agents de codage tels que Claude Code, Codex et Cursor, ainsi qu'un guide d'agent couvrant la détection du matériel, la réutilisation des données existantes, la demande avant le téléchargement des modèles et une génération de test. Des compétences peuvent être ajoutées avec npx skills add debpalash/VoiceStudio, en choisissant soit la compétence de flux de travail audio, soit la compétence de mainteneur.
L'exécution depuis les sources utilise Bun : cloner le dépôt, exécuter bun install, bun run setup:api pour préparer les dépendances Python, puis bun run dev. Une commande de test de fumée compile et lance une application Electron packagée isolée, avec une vérification optionnelle d'installation d'un runtime géré en réseau.
Le README indique qu'Electron est la seule application de bureau maintenue et que la version 0.5.3 était la dernière version Tauri ; les utilisateurs Tauri existants sont dirigés vers un document de migration, et le code source Tauri est archivé sans mises à jour ultérieures. Les commandes racine de développement, de compilation, de test et de publication ciblent Electron.
La documentation couvre le dépannage, les téléchargements de modèles, les guides de moteurs, les benchmarks, l'API de la plateforme vocale locale, l'intégration et les exemples MCP, ainsi que la contribution, la configuration d'Electron et un journal des modifications. Le projet est sous licence AGPL-3.0, avec une notice distincte couvrant les licences des modèles et l'usage responsable ; le README conseille de consulter les licences des modèles avant tout usage commercial et de ne cloner des voix qu'avec autorisation. Les canaux de parrainage et de dons sont listés.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.