这个项目能做什么

## 项目概览 Retrieval-based-Voice-Conversion-WebUI(RVC)是一个简单易用的语音音色转换/变声框架,提供网页操作界面。README 说明其底模使用接近 50 小时的开源 VCTK 训练集训练,并称无版权方面的顾虑。 ## 主要特点 - 使用 top1 检索,将输入源特征替换为训练集特征,以抑制音色泄漏。 - 在相对较差的显卡上也能较快训练。 - 少量数据即可训练,推荐至少收集 10 分钟低底噪语音数据。 - 可通过 ckpt-merge 进行模型融合以改变音色。 - 提供简单易用的网页界面。 - 可调用 pymss/MSST 模型分离人声与伴奏。 - 采用 InterSpeech2023-RMVPE 人声音高提取算法,README 称其可缓解哑音问题,速度快、资源占用小。 - AMD/Intel 显卡使用 CPU 依赖方案;Windows 可使用 DirectML,Linux 使用 CPU。 ## 界面与延迟 README 展示训练推理界面与实时变声界面。实时变声部分称已实现端到端 170ms 延迟;若使用 ASIO 输入输出设备,可实现端到端 90ms 延迟,但非常依赖硬件驱动支持。 ## 环境配置 该分支面向 Python 3.12 x64,需先进入仓库根目录,Ubuntu 推荐 Ubuntu 24.04 x86_64。 Ubuntu 24.04 需安装 python3.12、python3.12-venv、python3.12-dev、ffmpeg、unzip、libsndfile1、libportaudio2,然后创建虚拟环境并升级 pip、setuptools、wheel。Windows 安装 Python 3.12 x64 后同样创建虚拟环境。 依赖按硬件选择: - CPU、AMD、Intel:使用 requirments_cpu_py312.txt;Windows 可用 DirectML,Linux 使用 CPU。 - NVIDIA RTX 50 系:先安装 CUDA 12.8 版 Torch,再安装 requirments_cu128_py312.txt。 - NVIDIA RTX 50 系以前:先安装 CUDA 11.8 版 Torch,再安装 requirments_cu118_py312.txt。 README 提供了检查 Torch 与 CUDA 状态的命令。三个依赖文件顶部已包含下载源,中国大陆用户可保留默认镜像,或替换为官方源。 ## 模型与运行目录 WebUI 会自动创建运行目录。模型需从 Hugging Face 模型仓库下载,并保持指定路径,包括 assets/hubert_base、assets/rmvpe、assets/pretrained、assets/pretrained_v2、assets/pymss_weights、assets/weights、assets/indices 以及 logs/mute。README 给出了使用 huggingface_hub 下载各组件模型的命令,并说明仅 Windows AMD/Intel DirectML 环境还需要 rmvpe.onnx。 FFmpeg 在 Ubuntu 已随系统依赖安装;Windows 用户可把 ffmpeg.exe 与 ffprobe.exe 放到项目根目录。 ## 开始使用 启动 WebUI 使用 python webui.py;无桌面的 Ubuntu 服务器使用 python webui.py --noautoopen。默认服务监听端口为 7865。用户自己的 .pth 模型放入 assets/weights/,.index 文件放入 assets/indices/。 ## 参考项目 README 列出 ContentVec、VITS、HIFIGAN、Gradio、FFmpeg、Ultimate Vocal Remover、pymss、audio-slicer 以及 RMVPE 等参考项目,并说明 RMVPE 预训练模型由 yxlllc 与 RVC-Boss 训练和测试。