Об этом проекте

Speech To Speech — полностью модульный фреймворк для построения голосовых агентов с использованием open-source моделей. Он организует конвейер голосового взаимодействия в четыре взаимозаменяемых этапа: обнаружение речи (VAD), распознавание речи в текст (STT), большая языковая модель (LLM) и синтез речи из текста (TTS). Ключевые возможности: - **Модульная архитектура**: каждый компонент можно заменить. Поддерживаются различные бэкенды, включая MLX для Apple Silicon, CUDA для GPU NVIDIA и API, совместимые с OpenAI, для размещённых или самоходных серверов (например, vLLM, llama.cpp). - **Реализация Realtime API**: через WebSocket и WebRTC выставляется базовый набор событий OpenAI Realtime GA, что обеспечивает низкую задержку при смене реплик и транскрипцию в реальном времени. - **Гибкое развёртывание**: может запускаться полностью локально (на Mac или Linux), в гибридном режиме (локальная обработка речи с размещённой LLM) или в виде сервера для внешних клиентов. - **Широкая поддержка моделей**: - STT: Parakeet TDT, Whisper, Faster Whisper, Paraformer и Qwen3-ASR. - LLM: Transformers, mlx-lm и различные провайдеры, совместимые с OpenAI. - TTS: Qwen3-TTS, Kokoro-82M, Pocket TTS, ChatTTS и OmniVoice. - **Интеграция инструментов**: упакованный Python-клиент поддерживает вызов локальных инструментов через конкретный контракт модуля. - **Прокси LLM**: опционально предоставляет настроенную удалённую LLM в виде стандартного endpoint, совместимого с OpenAI, для параллельных побочных задач.