这个项目能做什么

Speech To Speech 是一个完全模块化的框架,用于利用开源模型构建语音代理。它将语音交互管道组织为四个可互换的阶段:语音活动检测(VAD)、语音转文字(STT)、大语言模型(LLM)和文字转语音(TTS)。 核心功能包括: - **模块化架构**:所有组件均可替换,支持 MLX(Apple Silicon)、CUDA(NVIDIA GPU)以及 OpenAI 兼容 API(如 vLLM、llama.cpp)等多种后端。 - **实时 API**:通过 WebSocket 和 WebRTC 暴露 OpenAI Realtime GA 事件集,实现低延迟的对话轮替和实时转录。 - **灵活部署**:支持完全本地运行(Mac 或 Linux)、混合模式(本地语音处理结合远程 LLM),或作为外部客户端的服务端。 - **广泛模型支持**: - STT:Parakeet TDT、Whisper、Faster Whisper、Paraformer 和 Qwen3-ASR。 - LLM:Transformers、mlx-lm 以及各种 OpenAI 兼容提供商。 - TTS:Qwen3-TTS、Kokoro-82M、Pocket TTS、ChatTTS 和 OmniVoice。 - **工具集成**:内置 Python 客户端通过特定模块契约支持本地工具调用。 - **LLM 代理**:可选地以标准 OpenAI 兼容端点形式暴露配置的远程 LLM,以处理并发辅助任务。