Об этом проекте
Speech To Speech — полностью модульный фреймворк для построения голосовых агентов с использованием open-source моделей. Он организует конвейер голосового взаимодействия в четыре взаимозаменяемых этапа: обнаружение речи (VAD), распознавание речи в текст (STT), большая языковая модель (LLM) и синтез речи из текста (TTS).
Ключевые возможности:
- **Модульная архитектура**: каждый компонент можно заменить. Поддерживаются различные бэкенды, включая MLX для Apple Silicon, CUDA для GPU NVIDIA и API, совместимые с OpenAI, для размещённых или самоходных серверов (например, vLLM, llama.cpp).
- **Реализация Realtime API**: через WebSocket и WebRTC выставляется базовый набор событий OpenAI Realtime GA, что обеспечивает низкую задержку при смене реплик и транскрипцию в реальном времени.
- **Гибкое развёртывание**: может запускаться полностью локально (на Mac или Linux), в гибридном режиме (локальная обработка речи с размещённой LLM) или в виде сервера для внешних клиентов.
- **Широкая поддержка моделей**:
- STT: Parakeet TDT, Whisper, Faster Whisper, Paraformer и Qwen3-ASR.
- LLM: Transformers, mlx-lm и различные провайдеры, совместимые с OpenAI.
- TTS: Qwen3-TTS, Kokoro-82M, Pocket TTS, ChatTTS и OmniVoice.
- **Интеграция инструментов**: упакованный Python-клиент поддерживает вызов локальных инструментов через конкретный контракт модуля.
- **Прокси LLM**: опционально предоставляет настроенную удалённую LLM в виде стандартного endpoint, совместимого с OpenAI, для параллельных побочных задач.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.