Sobre el proyecto

Speech To Speech es un marco completamente modular para construir agentes de voz utilizando modelos de código abierto. Organiza la tubería de interacción por voz en cuatro etapas intercambiables: Detección de Actividad de Voz (VAD), Voz a Texto (STT), Modelo de Lenguaje Grande (LLM) y Texto a Voz (TTS). Capacidades principales: - **Arquitectura modular**: Cada componente es intercambiable. Admite varios backends, incluidos MLX para Apple Silicon, CUDA para GPU NVIDIA y APIs compatibles con OpenAI para servidores alojados o autoalojados (por ejemplo, vLLM, llama.cpp). - **API en tiempo real**: Expone el conjunto de eventos OpenAI Realtime GA mediante WebSocket y WebRTC, permitiendo turnos de baja latencia y transcripción en vivo. - **Despliegue flexible**: Puede ejecutarse completamente de forma local (en Mac o Linux), en modo híbrido (voz local con LLM alojado) o como servidor para clientes externos. - **Amplio soporte de modelos**: - STT: Parakeet TDT, Whisper, Faster Whisper, Paraformer y Qwen3-ASR. - LLM: Transformers, mlx-lm y diversos proveedores compatibles con OpenAI. - TTS: Qwen3-TTS, Kokoro-82M, Pocket TTS, ChatTTS y OmniVoice. - **Integración de herramientas**: El cliente Python empaquetado admite llamadas locales a herramientas mediante un contrato de módulo específico. - **Proxy LLM**: Opcionalmente expone el LLM remoto configurado como un endpoint estándar compatible con OpenAI para tareas secundarias concurrentes.