프로젝트 소개
Pocket TTS는 Kyutai Labs가 개발한 오픈 소스 텍스트-음성 변환(TTS) 애플리케이션으로, GPU나 웹 API 없이 CPU에서 효율적으로 실행되도록 설계되었습니다. 이 모델은 약 1억 개의 매개변수를 가지며, MacBook Air M4에서 CPU 코어 2개만 사용하여 첫 오디오 청크까지 약 200ms, 실시간 속도의 약 6배에 달하는 저지연 오디오 생성에 최적화되어 있습니다.
이 프로젝트는 Python 3.10부터 3.14까지 지원하며, PyTorch 2.5 이상(CPU 전용 빌드 지원)이 필요합니다. Python 라이브러리 API와 명령줄 인터페이스(CLI)를 모두 제공하며, 오디오 생성(`generate`), 로컬 HTTP 서버 실행(`serve`), 음성 임베딩을 safetensors 파일로 내보내기(`export-voice`) 등의 명령을 포함합니다.
주요 기능은 다음과 같습니다:
- 오디오 샘플(wav 또는 mp3 파일)에서 음성 복제
- 영어, 프랑스어, 독일어, 포르투갈어, 이탈리아어, 스페인어 등 다국어 지원
- 무한히 긴 텍스트 입력을 지원하는 오디오 스트리밍
- Hugging Face에서 제공되는 다양한 사전 구축 음성 카탈로그
- 체코어, 힌디어, 한국어, 페르시아어, 인도네시아어, 에스토니아어 등 추가 언어를 위한 커뮤니티 훈련 모델
- 사용자가 자체 모델을 훈련할 수 있도록 훈련 코드 공개
또한 이 프로젝트는 WebAssembly/브라우저 버전, Rust 포트, C++ 구현, Apple Silicon용 MLX 백엔드, Home Assistant, Discord, Unity, ComfyUI와 같은 플랫폼과의 통합을 포함한 다양한 커뮤니티 구현 및 통합이 있습니다.
README에는 GPU 지원이 공식적으로 제공되지는 않지만, 모델을 수동으로 CUDA로 이동하여 달성할 수 있으며 특정 하드웨어 구성에서 측정된 속도 향상이 있다고 명시되어 있습니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.