funttsfarfarfun
신규FunTTS는 통합 인터페이스를 제공하는 텍스트 음성 변환(TTS) 라이브러리로, 다양한 오픈소스 TTS 엔진의 원활한 전환을 지원하며 자막 생성, 다역할 대화, 비동기 처리 등의 기능을 제공합니다.
우수한 오픈 소스 프로젝트를 발견하고, 익명으로 프로젝트를 제출하며, 내 프로젝트를 신청해 편집하세요.
호기심으로 오픈 소스의 세계를 발견하세요.
THE FIRST COLLECTIONFunTTS는 통합 인터페이스를 제공하는 텍스트 음성 변환(TTS) 라이브러리로, 다양한 오픈소스 TTS 엔진의 원활한 전환을 지원하며 자막 생성, 다역할 대화, 비동기 처리 등의 기능을 제공합니다.
WebSocket 및 WebRTC 위에서 OpenAI Realtime 이벤트 세트를 구현하는 낮은 지연 시간의 모듈형 음성 에이전트 파이프라인(VAD → STT → LLM → TTS).
VoxCPM2는 discrete tokenization 없이 연속 음성 표현을 생성하는 2B 파라미터 텍스트-음성 변환 시스템으로, 30개 언어를 지원하며 자연어 설명을 통한 음성 설계, 제어 가능한 음성 모방, 48kHz 오디오 출력을 제공한다.
NVIDIA NeMo Speech는 Apache-2.0 라이선스의 PyTorch 기반 음성 AI 모델 구축·커스터마이징·배포 프레임워크로, ASR, TTS, 음성 LLM을 지원하며 사전 학습된 체크포인트와 Docker/uv 설치 경로를 제공한다.
ESPnet은 PyTorch 기반의 종단 간 음성 처리 툴킷으로, ASR, TTS, 음성 번역, 향상, 화자 분리 등 다양한 작업을 지원하며 재현 가능한 레시피와 사전 학습 모델을 제공합니다.