프로젝트 소개
Speech To Speech는 오픈소스 모델을 활용해 음성 에이전트를 구축하기 위한 완전 모듈형 프레임워크입니다. 음성 상호작용 파이프라인을 네 개의 교체 가능한 단계로 구성합니다: 음성 활동 감지(VAD), 음성-텍스트 변환(STT), 대규모 언어 모델(LLM), 텍스트-음성 변환(TTS).
주요 기능:
- **모듈형 아키텍처**: 모든 구성 요소를 교체할 수 있으며, Apple Silicon용 MLX, NVIDIA GPU용 CUDA, 호스팅 또는 자체 호스팅 서버(vLLM, llama.cpp 등)용 OpenAI 호환 API를 포함한 다양한 백엔드를 지원합니다.
- **실시간 API**: WebSocket과 WebRTC를 통해 핵심 OpenAI Realtime GA 이벤트 세트를 제공하여 낮은 지연 시간의 턴テイキング과 실시간 자막을 가능하게 합니다.
- **유연한 배포**: Mac 또는 Linux에서 완전히 로컬로, 하이브리드 모드(로컬 음성과 호스팅 LLM), 또는 외부 클라이언트를 위한 서버로 실행 가능합니다.
- **광범위한 모델 지원**:
- STT: Parakeet TDT, Whisper, Faster Whisper, Paraformer, Qwen3-ASR
- LLM: Transformers, mlx-lm, 다양한 OpenAI 호환 제공업체
- TTS: Qwen3-TTS, Kokoro-82M, Pocket TTS, ChatTTS, OmniVoice
- **도구 통합**: 패키징된 Python 클라이언트는 특정 모듈 계약을 통한 로컬 도구 호출을 지원합니다.
- **LLM 프록시**: 선택적으로 구성된 원격 LLM을 동시 사이드 태스크를 위한 표준 OpenAI 호환 엔드포인트로 노출합니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.