这个项目能做什么

Dia 是由 Nari Labs 创建的 16 亿参数文本转语音模型。它可以直接从文本生成高度逼真的对话,通过 [S1] 和 [S2] 标签支持多个说话人。该模型可以生成笑声、咳嗽、叹气、清嗓子等非语言交流。用户可以通过音频提示来调节输出,实现情感、语气控制和语音克隆。该项目在 Hugging Face 上提供了预训练模型检查点、推理代码、Gradio 界面、命令行工具以及 Transformers 集成。目前,该模型仅支持英语生成。在 RTX 4090 上的基准测试结果显示,根据精度和编译方式的不同,实时因子在 x0.9 到 x2.2 之间,显存占用在 4.4GB 到 7.9GB 之间。该项目采用 Apache 2.0 许可证,仅供研究和教育用途,并限制将其用于身份滥用、欺骗性内容和非法活动。