프로젝트 소개
ChatTTS는 LLM 어시스턴트와 같은 대화 시나리오를 위한 생성형 텍스트-음성 모델입니다. 저장소는 알고리즘 인프라, 사전 훈련된 모델 가중치 및 추론을 위한 간단한 예제를 제공합니다.
지원하는 언어는 영어와 중국어이며, 추가 언어는 곧 출시될 예정입니다. 모델은 중국어와 영어 오디오 데이터로 훈련되었으며, HuggingFace에서의 오픈소스 배포는 SFT 없이 40,000시간의 사전 훈련 모델로 설명됩니다.
README에 기술된 주요 기능:
- 대화 기반 작업에 최적화된 대화형 TTS, 다중 스피커 지원.
- 억양 특성(웃음, 휴지, 중단)에 대한 세부 제어.
- [laugh], [uv_break], [lbreak]와 같은 토큰 수준 제어 단위, [oral_2][laugh_0][break_6]와 같은 프롬프트를 통한 문장 수준 제어.
- 가우시안 분포에서 스피커 샘플링, 샘플링된 스피커 임베딩은 이후 톤 복원을 위해 저장.
- 온도, top_P, top_K와 같은 조정 가능한 디코딩 매개변수.
- 스트리밍 오디오 생성.
시작 옵션에는 저장소 복제 및 pip 또는 conda를 통해 요구 사항 설치, PyPI 또는 GitHub에서 패키지 설치, WebUI 예제 또는 명령줄 추론 스크립트 실행이 포함됩니다. 기본 Python 사용 예제는 모델을 로드하고 텍스트 목록에 대한 추론을 실행하며, 24kHz에서 출력 WAV 파일을 저장합니다. 고급 예제는 스피커 샘플링, 문장 수준 및 단어 수준 제어, 자기소개 샘플을 포함합니다.
README는 하드웨어 요구 사항을 다음과 같이 기재합니다: 30초 길이의 오디오 클립에는 최소 4GB의 GPU 메모리가 필요하며, 4090 GPU에서는 RTF가 약 0.3입니다. 또한, 자기회귀 모델은 다중 스피커 출력 또는 저품질 오디오와 같은 불안정성을 보일 수 있으며, 여러 샘플을 시도할 것을 제안합니다.
라이선스: 코드는 AGPLv3+ 하에 배포되며, 모델은 교육 및 연구용으로만 사용 가능하며, 상업적 또는 불법 목적에는 사용할 수 없습니다. README는 40,000시간 모델 훈련 중 고주파 노이즈가 추가되었고, 오디오 품질은 MP3 형식으로 압축되어 잠재적인 오용을 제한한다고 명시합니다. 또한, 내부적으로 훈련된 감지 모델은 오픈소스로 공개될 예정입니다.
이 프로젝트는 bark, XTTSv2, valle, fish-speech 및 vocos와 같은 이전 작업을 인정하며, 확장된 최종 사용자 제품을 위한 커뮤니티 유지 관리 인덱스 저장소인 Awesome-ChatTTS를 지적합니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.