프로젝트 소개
# GPT-SoVITS
RVC-Boss가 개발한 강력한 few-shot 음성 변환 및 텍스트 음성 변환(TTS) WebUI입니다.
## 개요
GPT-SoVITS는 최소한의 학습 데이터로 음성 클로닝을 가능하게 합니다. 5초 보컬 샘플로 제로샷 TTS를 지원하며, 약 1분 데이터를 통해 모델을 파인튜닝하면 음성 유사성과 현실감이 향상됩니다.
## 주요 기능
1. **제로샷 TTS** — 5초 보컬 샘플 입력으로 즉시 텍스트 음성 변환
2. **피어샷 TTS** — 약 1분의 학습 데이터로 파인튜닝하여 높은 충실도 달성
3. **다국어 지원** — 학습 데이터와 다른 언어로 추론 가능(영어, 일본어, 한국어, 광둥어, 중국어)
4. **WebUI 도구** — 통합 파이프라인 포함:
- UVR5 기반 음성/반주 분리
- 자동 학습 세트 분할
- Fun-ASR-Nano, SenseVoice 또는 기존 FunASR 기반 다국어 ASR
- 데이터셋 생성을 위한 텍스트 주석 작성
## 버전
- **v2**: 한국어 및 광둥어 지원 추가, 사전 학습 모델 2k→5k 시간 확장, 저품질 참고 오디오 합성 품질 개선
- **v3**: 더 적은 학습 데이터로更高的 성량 유사성, 반복/생략이 적은 안정적 GPT 생성, 풍부한 감정 표현
- **v4**: v3의 비정수 업샘플링으로 인한 금속음 아티팩트 수정, 24k 대신 기본 48k 오디오 출력
- **v2Pro**: v2 수준의 하드웨어 요구사항으로 v4 성능 달성
## 설치
Windows, Linux(CUDA/ROCm), macOS(MPS/CPU), Docker를 지원합니다.
- Windows 사용자는 [통합 패키지](https://huggingface.co/lj1995/GPT-SoVITS-windows-package)를 다운로드하여 `go-webui.bat`을 실행하세요.
- Conda 기반 설치: `conda create -n GPTSoVits python=3.10 && conda activate GPTSoVits && bash install.sh`
- Docker 이미지는 Docker Hub에서 사용 가능
- 클라우드 학습용 Colab 노트북 제공
## 사전 학습 모델
모델은 Hugging Face에서 다운로드하여 `GPT_SoVITS/pretrained_models`에 배치합니다. G2PW(중국어 텍스트 프론트엔드), UVR5(음성 분리), ASR 백엔드(FunASR, Faster Whisper)용 추가 모델이 필요합니다.
## 데이터셋 형식
주석 파일 형식:
```
vocal_path|speaker_name|language|text
```
언어 코드: `zh`(중국어), `ja`(일본어), `en`(영어), `ko`(한국어), `yue`(광둥어)
## 사용법
- WebUI 실행: `python webui.py` 또는 `python GPT_SoVITS/inference_webui.py`
- 통합 패키지 사용자: `go-webui.bat` / `go-webui-v2.bat` 더블클릭
- UVR5 처리, 오디오 분할, ASR 전사용 명령줄 도구 제공
## 추론 속도
GPT-SoVITS v2 ProPlus의 RTF 벤치마크: RTX 4060 Ti에서 0.028, RTX 4090에서 0.014, Apple M4 CPU에서 0.526. Hugging Face Spaces에서 온라인 데모 이용 가능
## 감사의 글
VITS, SoundStorm, HiFi-GAN, BigVGAN 및 기타 오픈소스 음성 합성 프로젝트의 연구를 기반으로 구축되었습니다. WebUI 도구에는 UVR5, audio-slicer, FFmpeg, Gradio, FunASR가 포함됩니다.
## 라이선스
MIT License.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.