Sobre el proyecto

## Resumen del proyecto Retrieval-based-Voice-Conversion-WebUI (RVC) es un marco sencillo de conversión de timbre de voz / cambio de voz que ofrece una interfaz web. El README indica que el modelo base se entrenó con el conjunto de entrenamiento abierto VCTK de casi 50 horas y afirma que no hay problemas de derechos de autor. ## Características principales - Usa recuperación top1 para reemplazar las características de entrada por las del conjunto de entrenamiento, reduciendo la fuga de timbre. - Permite entrenar con relativa rapidez incluso en tarjetas gráficas modestas. - Se puede entrenar con pocos datos; se recomienda recopilar al menos 10 minutos de voz con poco ruido de fondo. - Permite fusionar modelos mediante ckpt-merge para cambiar el timbre. - Ofrece una interfaz web sencilla y fácil de usar. - Puede invocar los modelos pymss/MSST para separar voz y acompañamiento. - Emplea el algoritmo de extracción de tono humano InterSpeech2023-RMVPE; el README afirma que alivia el problema de la voz apagada, es rápido y ocupa pocos recursos. - Las tarjetas AMD/Intel usan una solución dependiente de CPU; en Windows se puede usar DirectML y en Linux CPU. ## Interfaz y latencia El README muestra la interfaz de entrenamiento e inferencia y la interfaz de cambio de voz en tiempo real. En la parte de tiempo real se indica que se ha logrado una latencia de extremo a extremo de 170 ms; con dispositivos de entrada/salida ASIO se puede alcanzar una latencia de extremo a extremo de 90 ms, aunque depende en gran medida del soporte del controlador de hardware. ## Configuración del entorno Esta rama está orientada a Python 3.12 x64; hay que entrar primero en el directorio raíz del repositorio. En Ubuntu se recomienda Ubuntu 24.04 x86_64. En Ubuntu 24.04 hay que instalar python3.12, python3.12-venv, python3.12-dev, ffmpeg, unzip, libsndfile1 y libportaudio2, y luego crear un entorno virtual y actualizar pip, setuptools y wheel. En Windows, tras instalar Python 3.12 x64, también se crea un entorno virtual. Las dependencias se eligen según el hardware: - CPU, AMD, Intel: usar requirments_cpu_py312.txt; en Windows se puede usar DirectML y en Linux CPU. - NVIDIA RTX 50: instalar primero Torch con CUDA 12.8 y luego requirments_cu128_py312.txt. - NVIDIA anterior a RTX 50: instalar primero Torch con CUDA 11.8 y luego requirments_cu118_py312.txt. El README proporciona comandos para comprobar el estado de Torch y CUDA. Los tres archivos de dependencias incluyen fuentes de descarga en la parte superior; los usuarios de China continental pueden mantener el espejo predeterminado o reemplazarlo por la fuente oficial. ## Modelos y directorios de ejecución La WebUI crea automáticamente los directorios de ejecución. Los modelos deben descargarse del repositorio de modelos de Hugging Face y mantener las rutas especificadas, incluyendo assets/hubert_base, assets/rmvpe, assets/pretrained, assets/pretrained_v2, assets/pymss_weights, assets/weights, assets/indices y logs/mute. El README ofrece comandos para descargar los modelos de cada componente con huggingface_hub y explica que solo el entorno Windows AMD/Intel DirectML necesita además rmvpe.onnx. FFmpeg ya se instala con las dependencias del sistema en Ubuntu; los usuarios de Windows pueden colocar ffmpeg.exe y ffprobe.exe en el directorio raíz del proyecto. ## Cómo empezar Para iniciar la WebUI se usa python webui.py; en un servidor Ubuntu sin escritorio se usa python webui.py --noautoopen. El servicio escucha por defecto en el puerto 7865. Los modelos .pth propios se colocan en assets/weights/ y los archivos .index en assets/indices/. ## Proyectos de referencia El README enumera ContentVec, VITS, HIFIGAN, Gradio, FFmpeg, Ultimate Vocal Remover, pymss, audio-slicer y RMVPE como proyectos de referencia, y señala que el modelo preentrenado de RMVPE fue entrenado y probado por yxlllc y RVC-Boss.