NVIDIA NeMo Speech es un marco de trabajo PyTorch bajo licencia Apache-2.0 para construir, personalizar y desplegar modelos de IA de voz, que cubre reconocimiento automático del habla, texto a voz y LLMs de voz, con puntos de control preentrenados y rutas de instalación mediante Docker/uv.
Código abierto. Nuevas posibilidades.
Descubre proyectos de código abierto de calidad, envía proyectos de forma anónima y reclama y edita tu propio proyecto.
Un poco de curiosidad. Un mundo de código abierto.
THE FIRST COLLECTIONESPnet es una herramienta de procesamiento de voz end-to-end basada en PyTorch que cubre ASR, TTS, traducción y más. Ofrece recetas reproducibles, cientos de modelos preentrenados y soporte para múltiples tareas como reconocimiento, síntesis y diarización.
FunTTS es una biblioteca de texto a voz con una interfaz unificada que permite cambiar sin problemas entre múltiples motores de TTS, ofreciendo generación de subtítulos, diálogos multi-rol y procesamiento asíncrono.
Un pipeline modular de agente de voz de baja latencia (VAD -> STT -> LLM -> TTS) que implementa el conjunto de eventos OpenAI Realtime sobre WebSocket y WebRTC.
VoxCPM2 es un sistema de texto a voz sin tokenizador con un modelo autoregresivo de difusión de 2B que soporta 30 idiomas, diseño de voz a partir de descripciones de texto, clonación de voz controlable y salida de audio de 48 kHz.