Un pipeline modular de agente de voz de baja latencia (VAD -> STT -> LLM -> TTS) que implementa el conjunto de eventos OpenAI Realtime sobre WebSocket y WebRTC.
OPEN SOURCE, OPEN TO EVERYONE
Código abierto. Nuevas posibilidades.
Descubre proyectos de código abierto de calidad, envía proyectos de forma anónima y reclama y edita tu propio proyecto.
✳Selección editorial · Descubre buen código abierto4109descubiertos
Un poco de curiosidad. Un mundo de código abierto.
THE FIRST COLLECTIONTopic: speech-translation清除
speech-to-speechhuggingface
NUEVOspeechNVIDIA-NeMo
NUEVONVIDIA NeMo Speech es un marco de trabajo PyTorch bajo licencia Apache-2.0 para construir, personalizar y desplegar modelos de IA de voz, que cubre reconocimiento automático del habla, texto a voz y LLMs de voz, con puntos de control preentrenados y rutas de instalación mediante Docker/uv.
espnetespnet
NUEVOESPnet es una herramienta de procesamiento de voz end-to-end basada en PyTorch que cubre ASR, TTS, traducción y más. Ofrece recetas reproducibles, cientos de modelos preentrenados y soporte para múltiples tareas como reconocimiento, síntesis y diarización.