这个项目能做什么

# GPT-SoVITS 由 RVC-Boss 开发的强大少样本语音转换与文字转语音 WebUI 工具。 ## 概述 GPT-SoVITS 以极少的训练数据实现语音克隆。5秒的音频样本即可支持零样本 TTS,而约1分钟的数据微调则可提升音色相似度和真实感。 ## 核心功能 1. **零样本 TTS** — 输入5秒语音样本即可即时进行文字转语音。 2. **少样本 TTS** — 使用约1分钟训练数据微调,获得更高保真度。 3. **跨语言支持** — 支持与训练数据集不同语言的推理,支持英语、日语、韩语、粤语和中文。 4. **WebUI 工具链** — 集成完整流程,包括: - 通过 UVR5 进行人声/伴奏分离 - 自动训练集分割 - 基于 Fun-ASR-Nano、SenseVoice 或经典 FunASR 的多语言语音识别 - 文本标注,辅助数据集构建 ## 版本 - **v2**:新增韩语和粤语支持,预训练模型从2k小时扩展至5k小时,改善低质量参考音频的合成品质量。 - **v3**:以更少的训练数据实现更高的音色相似度,GPT 生成更稳定,重复/遗漏更少,情感表达更丰富。 - **v4**:修复 v3 中因非整数上采样导致的金属音色问题;原生输出 48k 音频(v3 为 24k)。 - **v2Pro**:以 v2 级别的硬件需求实现与 v4 相当的性能。 ## 安装 支持平台包括 Windows、Linux(CUDA/ROCm)、macOS(MPS/CPU)和 Docker。 - Windows 用户可下载 [整合包](https://huggingface.co/lj1995/GPT-SoVITS-windows-package) 并运行 `go-webui.bat`。 - Conda 安装:`conda create -n GPTSoVits python=3.10 && conda activate GPTSoVits && bash install.sh` - Docker 镜像可在 Docker Hub 获取。 - 还提供 Colab 笔记本用于云端训练。 ## 预训练模型 模型从 Hugging Face 下载并放入 `GPT_SoVITS/pretrained_models` 目录。使用 G2PW(中文文本前端)、UVR5(人声分离)和 ASR 后端(FunASR、Faster Whisper)时需额外模型。 ## 数据集格式 标注文件格式如下: ``` vocal_path|speaker_name|language|text ``` 语言代码:`zh`(中文)、`ja`(日语)、`en`(英语)、`ko`(韩语)、`yue`(粤语)。 ## 使用方法 - 启动 WebUI:`python webui.py` 或 `python GPT_SoVITS/inference_webui.py` - 整合包用户:双击 `go-webui.bat` / `go-webui-v2.bat` - 命令行工具可用于 UVR5 处理、音频分割和 ASR 转录。 ## 推理速度 GPT-SoVITS v2 ProPlus 的 RTF 基准:RTX 4060 Ti 上为 0.028,RTX 4090 上为 0.014,Apple M4 CPU 上为 0.526。Hugging Face Spaces 提供在线演示。 ## 致谢 本项目基于 VITS、SoundStorm、HiFi-GAN、BigVGAN 及其他开源语音合成项目的研究成果。WebUI 工具集成 UVR5、audio-slicer、FFmpeg、Gradio 和 FunASR。 ## 许可证 MIT License。