这个项目能做什么
# GPT-SoVITS
由 RVC-Boss 开发的强大少样本语音转换与文字转语音 WebUI 工具。
## 概述
GPT-SoVITS 以极少的训练数据实现语音克隆。5秒的音频样本即可支持零样本 TTS,而约1分钟的数据微调则可提升音色相似度和真实感。
## 核心功能
1. **零样本 TTS** — 输入5秒语音样本即可即时进行文字转语音。
2. **少样本 TTS** — 使用约1分钟训练数据微调,获得更高保真度。
3. **跨语言支持** — 支持与训练数据集不同语言的推理,支持英语、日语、韩语、粤语和中文。
4. **WebUI 工具链** — 集成完整流程,包括:
- 通过 UVR5 进行人声/伴奏分离
- 自动训练集分割
- 基于 Fun-ASR-Nano、SenseVoice 或经典 FunASR 的多语言语音识别
- 文本标注,辅助数据集构建
## 版本
- **v2**:新增韩语和粤语支持,预训练模型从2k小时扩展至5k小时,改善低质量参考音频的合成品质量。
- **v3**:以更少的训练数据实现更高的音色相似度,GPT 生成更稳定,重复/遗漏更少,情感表达更丰富。
- **v4**:修复 v3 中因非整数上采样导致的金属音色问题;原生输出 48k 音频(v3 为 24k)。
- **v2Pro**:以 v2 级别的硬件需求实现与 v4 相当的性能。
## 安装
支持平台包括 Windows、Linux(CUDA/ROCm)、macOS(MPS/CPU)和 Docker。
- Windows 用户可下载 [整合包](https://huggingface.co/lj1995/GPT-SoVITS-windows-package) 并运行 `go-webui.bat`。
- Conda 安装:`conda create -n GPTSoVits python=3.10 && conda activate GPTSoVits && bash install.sh`
- Docker 镜像可在 Docker Hub 获取。
- 还提供 Colab 笔记本用于云端训练。
## 预训练模型
模型从 Hugging Face 下载并放入 `GPT_SoVITS/pretrained_models` 目录。使用 G2PW(中文文本前端)、UVR5(人声分离)和 ASR 后端(FunASR、Faster Whisper)时需额外模型。
## 数据集格式
标注文件格式如下:
```
vocal_path|speaker_name|language|text
```
语言代码:`zh`(中文)、`ja`(日语)、`en`(英语)、`ko`(韩语)、`yue`(粤语)。
## 使用方法
- 启动 WebUI:`python webui.py` 或 `python GPT_SoVITS/inference_webui.py`
- 整合包用户:双击 `go-webui.bat` / `go-webui-v2.bat`
- 命令行工具可用于 UVR5 处理、音频分割和 ASR 转录。
## 推理速度
GPT-SoVITS v2 ProPlus 的 RTF 基准:RTX 4060 Ti 上为 0.028,RTX 4090 上为 0.014,Apple M4 CPU 上为 0.526。Hugging Face Spaces 提供在线演示。
## 致谢
本项目基于 VITS、SoundStorm、HiFi-GAN、BigVGAN 及其他开源语音合成项目的研究成果。WebUI 工具集成 UVR5、audio-slicer、FFmpeg、Gradio 和 FunASR。
## 许可证
MIT License。
评论
0 评分人数达到10人后显示
登录后参与讨论。