À propos du projet
ChatTTS est un modèle de synthèse vocale génératif conçu spécifiquement pour les scénarios de dialogue tels que les assistants LLM. Le dépôt fournit l'infrastructure algorithmique, les poids du modèle pré-entraîné et des exemples simples pour l'inférence.
Les langues prises en charge sont l'anglais et le chinois, avec d'autres langues mentionnées comme bientôt disponibles. Le modèle a été entraîné sur des données audio en chinois et en anglais, et la version open source sur HuggingFace est décrite comme un modèle pré-entraîné de 40 000 heures sans SFT.
Fonctionnalités clés mentionnées dans le README :
- TTS conversationnelle optimisée pour les tâches basées sur les dialogues, avec prise en charge de plusieurs locuteurs.
- Contrôle fin des caractéristiques prosodiques, y compris les rires, les pauses et les interjections.
- Unités de contrôle au niveau des tokens tels que [laugh], [uv_break] et [lbreak], ainsi que le contrôle au niveau des phrases via des prompts comme [oral_2][laugh_0][break_6].
- Échantillonnage du locuteur à partir d'une distribution gaussienne, avec l'embedding du locuteur échantillonné enregistré pour une récupération ultérieure du timbre.
- Paramètres d'inférence ajustables incluant la température, top_P et top_K.
- Génération audio en streaming.
Options pour commencer : cloner le dépôt et installer les dépendances via pip ou conda, installer le package depuis PyPI ou GitHub, et exécuter soit un exemple WebUI soit un script d'inférence en ligne de commande. Un exemple d'utilisation Python de base charge le modèle, exécute l'inférence sur une liste de textes et enregistre les fichiers WAV en sortie à 24 kHz. Des exemples avancés couvrent l'échantillonnage du locuteur, le contrôle au niveau des phrases et des mots, ainsi qu'un exemple d'introduction personnelle.
Le README mentionne les attentes en termes de matériel : au moins 4 Go de mémoire GPU pour un clip audio de 30 secondes, et sur une GPU 4090, un RTF d'environ 0,3. Il précise également que les modèles autoregressifs peuvent présenter une instabilité telle que la sortie multi-locuteurs ou une qualité audio médiocre, et suggère d'essayer plusieurs échantillons.
Licence : le code est publié sous licence AGPLv3+, tandis que le modèle est publié sous licence CC BY-NC 4.0 pour un usage éducatif et de recherche, pas à des fins commerciales ou illégales. Le README indique qu'un petit bruit à haute fréquence a été ajouté pendant l'entraînement du modèle de 40 000 heures et que la qualité audio a été compressée au format MP3 pour limiter les abus potentiels, et qu'un modèle de détection entraîné en interne est prévu pour une libération open source.
Le projet remercie les travaux antérieurs tels que bark, XTTSv2, valle, fish-speech et vocos, et pointe vers un dépôt index communautaire, Awesome-ChatTTS, pour des produits finaux étendus.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.