프로젝트 소개

# GPT-SoVITS RVC-Boss가 개발한 강력한 few-shot 음성 변환 및 텍스트 음성 변환(TTS) WebUI입니다. ## 개요 GPT-SoVITS는 최소한의 학습 데이터로 음성 클로닝을 가능하게 합니다. 5초 보컬 샘플로 제로샷 TTS를 지원하며, 약 1분 데이터를 통해 모델을 파인튜닝하면 음성 유사성과 현실감이 향상됩니다. ## 주요 기능 1. **제로샷 TTS** — 5초 보컬 샘플 입력으로 즉시 텍스트 음성 변환 2. **피어샷 TTS** — 약 1분의 학습 데이터로 파인튜닝하여 높은 충실도 달성 3. **다국어 지원** — 학습 데이터와 다른 언어로 추론 가능(영어, 일본어, 한국어, 광둥어, 중국어) 4. **WebUI 도구** — 통합 파이프라인 포함: - UVR5 기반 음성/반주 분리 - 자동 학습 세트 분할 - Fun-ASR-Nano, SenseVoice 또는 기존 FunASR 기반 다국어 ASR - 데이터셋 생성을 위한 텍스트 주석 작성 ## 버전 - **v2**: 한국어 및 광둥어 지원 추가, 사전 학습 모델 2k→5k 시간 확장, 저품질 참고 오디오 합성 품질 개선 - **v3**: 더 적은 학습 데이터로更高的 성량 유사성, 반복/생략이 적은 안정적 GPT 생성, 풍부한 감정 표현 - **v4**: v3의 비정수 업샘플링으로 인한 금속음 아티팩트 수정, 24k 대신 기본 48k 오디오 출력 - **v2Pro**: v2 수준의 하드웨어 요구사항으로 v4 성능 달성 ## 설치 Windows, Linux(CUDA/ROCm), macOS(MPS/CPU), Docker를 지원합니다. - Windows 사용자는 [통합 패키지](https://huggingface.co/lj1995/GPT-SoVITS-windows-package)를 다운로드하여 `go-webui.bat`을 실행하세요. - Conda 기반 설치: `conda create -n GPTSoVits python=3.10 && conda activate GPTSoVits && bash install.sh` - Docker 이미지는 Docker Hub에서 사용 가능 - 클라우드 학습용 Colab 노트북 제공 ## 사전 학습 모델 모델은 Hugging Face에서 다운로드하여 `GPT_SoVITS/pretrained_models`에 배치합니다. G2PW(중국어 텍스트 프론트엔드), UVR5(음성 분리), ASR 백엔드(FunASR, Faster Whisper)용 추가 모델이 필요합니다. ## 데이터셋 형식 주석 파일 형식: ``` vocal_path|speaker_name|language|text ``` 언어 코드: `zh`(중국어), `ja`(일본어), `en`(영어), `ko`(한국어), `yue`(광둥어) ## 사용법 - WebUI 실행: `python webui.py` 또는 `python GPT_SoVITS/inference_webui.py` - 통합 패키지 사용자: `go-webui.bat` / `go-webui-v2.bat` 더블클릭 - UVR5 처리, 오디오 분할, ASR 전사용 명령줄 도구 제공 ## 추론 속도 GPT-SoVITS v2 ProPlus의 RTF 벤치마크: RTX 4060 Ti에서 0.028, RTX 4090에서 0.014, Apple M4 CPU에서 0.526. Hugging Face Spaces에서 온라인 데모 이용 가능 ## 감사의 글 VITS, SoundStorm, HiFi-GAN, BigVGAN 및 기타 오픈소스 음성 합성 프로젝트의 연구를 기반으로 구축되었습니다. WebUI 도구에는 UVR5, audio-slicer, FFmpeg, Gradio, FunASR가 포함됩니다. ## 라이선스 MIT License.