这个项目能做什么

Real-Time Voice Cloning 是论文《从说话人验证到多说话人文本转语音合成的迁移学习》(SV2TTS)的实现,最初作为硕士论文开发。它可以从几秒的音频中克隆声音,然后实时生成任意语音。 SV2TTS 是一个三阶段深度学习框架。第一阶段从几秒音频中创建声音的数字表示(基于 GE2E 的说话人编码器)。在第二和第三阶段,该表示被用作参考,通过基于 Tacotron 的合成器和 WaveRNN 声码器为任意文本合成语音。该仓库实现了 SV2TTS 和 GE2E 编码器本身,并基于 fatchord/WaveRNN 构建声码器和合成器组件。 该项目提供了一个工具箱,包含图形用户界面(demo_toolbox.py)和命令行界面(demo_cli.py)。支持 Windows 和 Linux。设置需要 ffmpeg 用于读取音频文件,以及 uv 用于 Python 包管理;工具箱可以使用 NVIDIA GPU 的 CUDA 附加组件或 CPU 附加组件运行。预训练模型会自动下载,也可从 Hugging Face 手动下载。可选数据集(如 LibriSpeech train-clean-100)可用于实验,但用户也可以提供自己的音频文件或在工具箱中直接录制。 README 指出该仓库已老化,许多付费 SaaS 服务现在提供更好的音频质量。它引导读者参考 Papers with Code 了解最新的语音合成研究,并推荐 Chatterbox 作为更现代的开源替代方案。