À propos du projet
Dia est un modèle de synthèse vocale de 1,6 milliard de paramètres créé par Nari Labs. Il génère directement des dialogues très réalistes à partir d'une transcription, prenant en charge plusieurs locuteurs grâce aux balises [S1] et [S2]. Le modèle peut produire des communications non verbales telles que des rires, de la toux, des soupirs et des raclements de gorge. Les utilisateurs peuvent conditionner la sortie sur des invites audio pour le contrôle des émotions, du ton et le clonage vocal. Le projet fournit des points de contrôle de modèle pré-entraînés sur Hugging Face, du code d'inférence, une interface utilisateur Gradio, une interface en ligne de commande et une intégration Transformers. Actuellement, le modèle ne prend en charge que la génération en anglais. Les résultats de référence sur un RTX 4090 montrent des facteurs en temps réel allant de x0,9 à x2,2 selon la précision et la compilation, avec une utilisation de mémoire VRAM comprise entre 4,4 Go et 7,9 Go. Le projet est sous licence Apache 2.0 et est destiné à un usage de recherche et éducatif, avec des restrictions contre l'utilisation abusive de l'identité, le contenu trompeur et les activités illégales.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.