这个项目能做什么
ChatTTS是一款专为对话场景(如LLM助手)设计的生成式文本转语音模型。仓库提供了算法基础设施、预训练模型权重和简单的推理示例。
支持的语言包括英语和中文,其他语言将在后续添加。该模型基于中英文语音数据训练,HuggingFace上的开源版本被描述为40,000小时预训练模型,未进行SFT微调。
README中描述的关键功能包括:
- 针对对话任务优化的对话式TTS,支持多说话人。
- 对韵律特征的精细控制,包括笑声、停顿和插话。
- 令牌级控制单元如[laugh]、[uv_break]和[lbreak],以及通过[oral_2][laugh_0][break_6]等提示实现的句子级控制。
- 从高斯分布中采样说话人,采样后的说话人嵌入可保存用于后续音色恢复。
- 可调节的解码参数,包括温度、top_P和top_K。
- 流式音频生成。
入门方式包括克隆仓库并通过pip或conda安装依赖,从PyPI或GitHub安装包,运行WebUI示例或命令行推理脚本。基础Python用法加载模型,对文本列表进行推理,并以24kHz保存输出WAV文件。高级示例涵盖说话人采样、句子级和单词级控制,以及自我介绍示例。
README提到硬件要求:生成30秒音频片段至少需要4GB显存,在4090显卡上RTF约为0.3。同时指出自回归模型可能出现多说话人输出或音频质量不佳的问题,建议尝试多个样本。
许可证:代码采用AGPLv3+协议发布,模型采用CC BY-NC 4.0协议,仅限教育和研究用途,不可用于商业或非法目的。README提到40,000小时模型训练期间添加了少量高频噪声,并通过MP3格式压缩音频质量以限制潜在滥用,同时计划开源内部训练的检测模型。
该项目承认了之前的工作,包括bark、XTTSv2、valle、fish-speech和vocos,并指向社区维护的索引仓库Awesome-ChatTTS,以提供扩展的终端用户产品。
评论
0 评分人数达到10人后显示
登录后参与讨论。