À propos du projet
## Aperçu du projet
Retrieval-based-Voice-Conversion-WebUI (RVC) est un cadre de conversion de timbre vocal / changement de voix simple à utiliser, fournissant une interface web. Le README indique que le modèle de base est entraîné sur le jeu de données open source VCTK de près de 50 heures, et affirme qu'il n'y a pas de préoccupations en matière de droits d'auteur.
## Caractéristiques principales
- Utilise la recherche top1 pour remplacer les caractéristiques de la source d'entrée par celles de l'ensemble d'entraînement, afin de supprimer les fuites de timbre.
- Entraînement rapide même sur des cartes graphiques relativement faibles.
- Peu de données suffisent pour l'entraînement ; il est recommandé de collecter au moins 10 minutes de données vocales à faible bruit de fond.
- Fusion de modèles possible via ckpt-merge pour modifier le timbre.
- Interface web simple et conviviale.
- Peut utiliser les modèles pymss/MSST pour séparer la voix et l'accompagnement.
- Utilise l'algorithme d'extraction de hauteur vocale InterSpeech2023-RMVPE, qui, selon le README, atténue les problèmes de voix muette, avec une vitesse rapide et une faible consommation de ressources.
- Les cartes graphiques AMD/Intel utilisent une solution dépendante du CPU ; Windows peut utiliser DirectML, Linux utilise le CPU.
## Interface et latence
Le README montre l'interface d'entraînement et d'inférence ainsi que l'interface de conversion en temps réel. Pour la conversion en temps réel, il est indiqué qu'une latence de bout en bout de 170 ms a été atteinte ; avec des périphériques d'entrée/sortie ASIO, une latence de bout en bout de 90 ms est possible, mais cela dépend fortement du support des pilotes matériels.
## Configuration de l'environnement
Cette branche est destinée à Python 3.12 x64 ; il faut d'abord entrer dans le répertoire racine du dépôt. Ubuntu est recommandé avec Ubuntu 24.04 x86_64.
Sur Ubuntu 24.04, il faut installer python3.12, python3.12-venv, python3.12-dev, ffmpeg, unzip, libsndfile1, libportaudio2, puis créer un environnement virtuel et mettre à niveau pip, setuptools, wheel. Sous Windows, après l'installation de Python 3.12 x64, créer également un environnement virtuel.
Les dépendances sont choisies selon le matériel :
- CPU, AMD, Intel : utiliser requirments_cpu_py312.txt ; Windows peut utiliser DirectML, Linux utilise le CPU.
- NVIDIA RTX 50 série : installer d'abord Torch version CUDA 12.8, puis installer requirments_cu128_py312.txt.
- NVIDIA avant RTX 50 série : installer d'abord Torch version CUDA 11.8, puis installer requirments_cu118_py312.txt.
Le README fournit des commandes pour vérifier l'état de Torch et CUDA. Les trois fichiers de dépendances contiennent déjà des sources de téléchargement en haut ; les utilisateurs en Chine continentale peuvent conserver le miroir par défaut ou le remplacer par la source officielle.
## Modèles et répertoires d'exécution
La WebUI crée automatiquement les répertoires d'exécution. Les modèles doivent être téléchargés depuis le dépôt Hugging Face et conservés aux chemins spécifiés, notamment assets/hubert_base, assets/rmvpe, assets/pretrained, assets/pretrained_v2, assets/pymss_weights, assets/weights, assets/indices et logs/mute. Le README donne des commandes pour télécharger chaque composant avec huggingface_hub, et précise que seul l'environnement Windows AMD/Intel DirectML nécessite également rmvpe.onnx.
FFmpeg est installé avec les dépendances système sur Ubuntu ; les utilisateurs Windows peuvent placer ffmpeg.exe et ffprobe.exe dans le répertoire racine du projet.
## Démarrage
Pour lancer la WebUI, utiliser python webui.py ; pour un serveur Ubuntu sans interface graphique, utiliser python webui.py --noautoopen. Le service écoute par défaut sur le port 7865. Les modèles .pth de l'utilisateur doivent être placés dans assets/weights/, et les fichiers .index dans assets/indices/.
## Projets de référence
Le README liste ContentVec, VITS, HIFIGAN, Gradio, FFmpeg, Ultimate Vocal Remover, pymss, audio-slicer et RMVPE comme projets de référence, et précise que le modèle pré-entraîné RMVPE a été entraîné et testé par yxlllc et RVC-Boss.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.