Sobre el proyecto
## Resumen del proyecto
Retrieval-based-Voice-Conversion-WebUI (RVC) es un marco sencillo de conversión de timbre de voz / cambio de voz que ofrece una interfaz web. El README indica que el modelo base se entrenó con el conjunto de entrenamiento abierto VCTK de casi 50 horas y afirma que no hay problemas de derechos de autor.
## Características principales
- Usa recuperación top1 para reemplazar las características de entrada por las del conjunto de entrenamiento, reduciendo la fuga de timbre.
- Permite entrenar con relativa rapidez incluso en tarjetas gráficas modestas.
- Se puede entrenar con pocos datos; se recomienda recopilar al menos 10 minutos de voz con poco ruido de fondo.
- Permite fusionar modelos mediante ckpt-merge para cambiar el timbre.
- Ofrece una interfaz web sencilla y fácil de usar.
- Puede invocar los modelos pymss/MSST para separar voz y acompañamiento.
- Emplea el algoritmo de extracción de tono humano InterSpeech2023-RMVPE; el README afirma que alivia el problema de la voz apagada, es rápido y ocupa pocos recursos.
- Las tarjetas AMD/Intel usan una solución dependiente de CPU; en Windows se puede usar DirectML y en Linux CPU.
## Interfaz y latencia
El README muestra la interfaz de entrenamiento e inferencia y la interfaz de cambio de voz en tiempo real. En la parte de tiempo real se indica que se ha logrado una latencia de extremo a extremo de 170 ms; con dispositivos de entrada/salida ASIO se puede alcanzar una latencia de extremo a extremo de 90 ms, aunque depende en gran medida del soporte del controlador de hardware.
## Configuración del entorno
Esta rama está orientada a Python 3.12 x64; hay que entrar primero en el directorio raíz del repositorio. En Ubuntu se recomienda Ubuntu 24.04 x86_64.
En Ubuntu 24.04 hay que instalar python3.12, python3.12-venv, python3.12-dev, ffmpeg, unzip, libsndfile1 y libportaudio2, y luego crear un entorno virtual y actualizar pip, setuptools y wheel. En Windows, tras instalar Python 3.12 x64, también se crea un entorno virtual.
Las dependencias se eligen según el hardware:
- CPU, AMD, Intel: usar requirments_cpu_py312.txt; en Windows se puede usar DirectML y en Linux CPU.
- NVIDIA RTX 50: instalar primero Torch con CUDA 12.8 y luego requirments_cu128_py312.txt.
- NVIDIA anterior a RTX 50: instalar primero Torch con CUDA 11.8 y luego requirments_cu118_py312.txt.
El README proporciona comandos para comprobar el estado de Torch y CUDA. Los tres archivos de dependencias incluyen fuentes de descarga en la parte superior; los usuarios de China continental pueden mantener el espejo predeterminado o reemplazarlo por la fuente oficial.
## Modelos y directorios de ejecución
La WebUI crea automáticamente los directorios de ejecución. Los modelos deben descargarse del repositorio de modelos de Hugging Face y mantener las rutas especificadas, incluyendo assets/hubert_base, assets/rmvpe, assets/pretrained, assets/pretrained_v2, assets/pymss_weights, assets/weights, assets/indices y logs/mute. El README ofrece comandos para descargar los modelos de cada componente con huggingface_hub y explica que solo el entorno Windows AMD/Intel DirectML necesita además rmvpe.onnx.
FFmpeg ya se instala con las dependencias del sistema en Ubuntu; los usuarios de Windows pueden colocar ffmpeg.exe y ffprobe.exe en el directorio raíz del proyecto.
## Cómo empezar
Para iniciar la WebUI se usa python webui.py; en un servidor Ubuntu sin escritorio se usa python webui.py --noautoopen. El servicio escucha por defecto en el puerto 7865. Los modelos .pth propios se colocan en assets/weights/ y los archivos .index en assets/indices/.
## Proyectos de referencia
El README enumera ContentVec, VITS, HIFIGAN, Gradio, FFmpeg, Ultimate Vocal Remover, pymss, audio-slicer y RMVPE como proyectos de referencia, y señala que el modelo preentrenado de RMVPE fue entrenado y probado por yxlllc y RVC-Boss.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.