프로젝트 소개

Real-Time Voice Cloning은 논문 "Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis"(SV2TTS)의 구현으로, 원래 석사 학위 논문으로 개발되었다. 몇 초 분량의 오디오에서 목소리를 복제한 뒤 임의의 음성을 실시간으로 생성한다. SV2TTS는 3단계 딥러닝 프레임워크다. 첫 번째 단계에서는 몇 초 분량의 오디오로부터 목소리의 디지털 표현을 생성한다(GE2E 기반 화자 인코더). 두 번째와 세 번째 단계에서는 그 표현을 참조로 사용하여 Tacotron 기반 합성기와 WaveRNN 보코더로 임의 텍스트에 대한 음성을 합성한다. 이 저장소는 SV2TTS와 GE2E 인코더 자체를 구현하며, 보코더와 합성기 구성 요소는 fatchord/WaveRNN을 기반으로 한다. 이 프로젝트는 GUI(demo_toolbox.py)와 명령줄 인터페이스(demo_cli.py)를 모두 갖춘 도구상자를 제공한다. Windows와 Linux를 지원한다. 설정에는 오디오 파일을 읽기 위한 ffmpeg와 Python 패키지 관리를 위한 uv가 필요하며, 도구상자는 NVIDIA GPU용 CUDA extra 또는 CPU extra 중 하나로 실행할 수 있다. 사전학습 모델은 자동으로 다운로드되며, Hugging Face에서 수동으로 다운로드할 수도 있다. LibriSpeech train-clean-100과 같은 선택적 데이터셋을 실험에 사용할 수 있지만, 사용자가 직접 오디오 파일을 제공하거나 도구상자에서 직접 녹음할 수도 있다. README는 이 저장소가 오래되었으며, 이제 많은 유료 SaaS 서비스가 더 나은 오디오 품질을 제공한다고 언급한다. 최근 음성 합성 연구는 Papers with Code에서, 더 최신 오픈소스 대안은 Chatterbox에서 찾아보도록 안내한다.