这个项目能做什么
Speech To Speech 是一个完全模块化的框架,用于利用开源模型构建语音代理。它将语音交互管道组织为四个可互换的阶段:语音活动检测(VAD)、语音转文字(STT)、大语言模型(LLM)和文字转语音(TTS)。
核心功能包括:
- **模块化架构**:所有组件均可替换,支持 MLX(Apple Silicon)、CUDA(NVIDIA GPU)以及 OpenAI 兼容 API(如 vLLM、llama.cpp)等多种后端。
- **实时 API**:通过 WebSocket 和 WebRTC 暴露 OpenAI Realtime GA 事件集,实现低延迟的对话轮替和实时转录。
- **灵活部署**:支持完全本地运行(Mac 或 Linux)、混合模式(本地语音处理结合远程 LLM),或作为外部客户端的服务端。
- **广泛模型支持**:
- STT:Parakeet TDT、Whisper、Faster Whisper、Paraformer 和 Qwen3-ASR。
- LLM:Transformers、mlx-lm 以及各种 OpenAI 兼容提供商。
- TTS:Qwen3-TTS、Kokoro-82M、Pocket TTS、ChatTTS 和 OmniVoice。
- **工具集成**:内置 Python 客户端通过特定模块契约支持本地工具调用。
- **LLM 代理**:可选地以标准 OpenAI 兼容端点形式暴露配置的远程 LLM,以处理并发辅助任务。
评论
0 评分人数达到10人后显示
登录后参与讨论。