这个项目能做什么
## 项目概览
Retrieval-based-Voice-Conversion-WebUI(RVC)是一个简单易用的语音音色转换/变声框架,提供网页操作界面。README 说明其底模使用接近 50 小时的开源 VCTK 训练集训练,并称无版权方面的顾虑。
## 主要特点
- 使用 top1 检索,将输入源特征替换为训练集特征,以抑制音色泄漏。
- 在相对较差的显卡上也能较快训练。
- 少量数据即可训练,推荐至少收集 10 分钟低底噪语音数据。
- 可通过 ckpt-merge 进行模型融合以改变音色。
- 提供简单易用的网页界面。
- 可调用 pymss/MSST 模型分离人声与伴奏。
- 采用 InterSpeech2023-RMVPE 人声音高提取算法,README 称其可缓解哑音问题,速度快、资源占用小。
- AMD/Intel 显卡使用 CPU 依赖方案;Windows 可使用 DirectML,Linux 使用 CPU。
## 界面与延迟
README 展示训练推理界面与实时变声界面。实时变声部分称已实现端到端 170ms 延迟;若使用 ASIO 输入输出设备,可实现端到端 90ms 延迟,但非常依赖硬件驱动支持。
## 环境配置
该分支面向 Python 3.12 x64,需先进入仓库根目录,Ubuntu 推荐 Ubuntu 24.04 x86_64。
Ubuntu 24.04 需安装 python3.12、python3.12-venv、python3.12-dev、ffmpeg、unzip、libsndfile1、libportaudio2,然后创建虚拟环境并升级 pip、setuptools、wheel。Windows 安装 Python 3.12 x64 后同样创建虚拟环境。
依赖按硬件选择:
- CPU、AMD、Intel:使用 requirments_cpu_py312.txt;Windows 可用 DirectML,Linux 使用 CPU。
- NVIDIA RTX 50 系:先安装 CUDA 12.8 版 Torch,再安装 requirments_cu128_py312.txt。
- NVIDIA RTX 50 系以前:先安装 CUDA 11.8 版 Torch,再安装 requirments_cu118_py312.txt。
README 提供了检查 Torch 与 CUDA 状态的命令。三个依赖文件顶部已包含下载源,中国大陆用户可保留默认镜像,或替换为官方源。
## 模型与运行目录
WebUI 会自动创建运行目录。模型需从 Hugging Face 模型仓库下载,并保持指定路径,包括 assets/hubert_base、assets/rmvpe、assets/pretrained、assets/pretrained_v2、assets/pymss_weights、assets/weights、assets/indices 以及 logs/mute。README 给出了使用 huggingface_hub 下载各组件模型的命令,并说明仅 Windows AMD/Intel DirectML 环境还需要 rmvpe.onnx。
FFmpeg 在 Ubuntu 已随系统依赖安装;Windows 用户可把 ffmpeg.exe 与 ffprobe.exe 放到项目根目录。
## 开始使用
启动 WebUI 使用 python webui.py;无桌面的 Ubuntu 服务器使用 python webui.py --noautoopen。默认服务监听端口为 7865。用户自己的 .pth 模型放入 assets/weights/,.index 文件放入 assets/indices/。
## 参考项目
README 列出 ContentVec、VITS、HIFIGAN、Gradio、FFmpeg、Ultimate Vocal Remover、pymss、audio-slicer 以及 RMVPE 等参考项目,并说明 RMVPE 预训练模型由 yxlllc 与 RVC-Boss 训练和测试。
评论
0 评分人数达到10人后显示
登录后参与讨论。