À propos du projet

Real-Time Voice Cloning est une implémentation de l'article « Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis » (SV2TTS), initialement développé comme mémoire de master. Il clone une voix à partir de quelques secondes d'audio, puis génère n'importe quelle parole en temps réel. SV2TTS est un cadre d'apprentissage profond en trois étapes. La première étape crée une représentation numérique d'une voix à partir de quelques secondes d'audio (un encodeur de locuteur basé sur GE2E). Dans les deuxième et troisième étapes, cette représentation est utilisée comme référence pour synthétiser la parole pour n'importe quel texte, à l'aide d'un synthétiseur basé sur Tacotron et d'un vocodeur WaveRNN. Le dépôt implémente SV2TTS et l'encodeur GE2E lui-même, et s'appuie sur fatchord/WaveRNN pour les composants de vocodeur et de synthétiseur. Le projet fournit une boîte à outils avec à la fois une interface graphique (demo_toolbox.py) et une interface en ligne de commande (demo_cli.py). Windows et Linux sont pris en charge. L'installation nécessite ffmpeg pour lire les fichiers audio et uv pour la gestion des paquets Python ; la boîte à outils peut être exécutée avec soit un extra CUDA pour les GPU NVIDIA, soit un extra CPU. Les modèles pré-entraînés sont téléchargés automatiquement, avec des téléchargements manuels disponibles depuis Hugging Face. Des jeux de données optionnels tels que LibriSpeech train-clean-100 peuvent être utilisés pour l'expérimentation, bien que les utilisateurs puissent plutôt fournir leurs propres fichiers audio ou enregistrer directement dans la boîte à outils. Le README note que le dépôt a vieilli, et que de nombreux services SaaS payants offrent désormais une meilleure qualité audio. Il oriente les lecteurs vers Papers with Code pour la recherche récente en synthèse vocale et vers Chatterbox comme alternative open source plus actuelle.