ESPnet es una herramienta de procesamiento de voz end-to-end basada en PyTorch que cubre ASR, TTS, traducción y más. Ofrece recetas reproducibles, cientos de modelos preentrenados y soporte para múltiples tareas como reconocimiento, síntesis y diarización.
Código abierto. Nuevas posibilidades.
Descubre proyectos de código abierto de calidad, envía proyectos de forma anónima y reclama y edita tu propio proyecto.
Un poco de curiosidad. Un mundo de código abierto.
THE FIRST COLLECTIONWhisperLiveKit (WLK) es un sistema de voz a texto de código abierto y autoalojado diseñado para transcripción en tiempo real de ultra baja latencia. Soporta múltiples modelos y provides APIs compatibles con OpenAI y Deepgram.
Batchalign3 es un pipeline de audio y ML de TalkBank para producir y enriquecer transcripciones CHAT, que cubre ASR, alineación forzada, morfoetiquetado neuronal, traducción y segmentación de enunciados. Incluye una CLI, paquete de Python, puente PyO3, panel de React y un shell de escritorio Tauri experimental.
SpeechRecognition es una biblioteca de Python para reconocimiento de voz compatible con múltiples motores y API, tanto en línea como fuera de línea, incluidos CMU Sphinx, Google, Azure, IBM, Vosk, Whisper y OpenAI.
Mimora is a free, fully local pronunciation trainer for English and Spanish. It uses on-device TTS, speech recognition, and a local LLM to generate phrases and score user attempts with word-level feedback, requiring no cloud or API keys.
Una implementación de C/C++ de alto rendimiento para la inferencia del modelo de reconocimiento automático de voz (ASR) Whisper de OpenAI, diseñada para un despliegue ligero y multiplataforma.
Premove ITN es una biblioteca de normalización inversa de texto (ITN) de código abierto y consciente del contexto para transcripciones de agentes de voz en inglés. Convierte la salida de ASR en formas escritas canónicas mediante un pipeline de generar-puntuar-decodificar con puntuación contextual DeBERTa. Alcanza un 99,50% de precisión semántica en su subconjunto de prueba.
Una reimplementación rápida del modelo Whisper de OpenAI utilizando CTranslate2, que ofrece una mayor velocidad de transcripción y un menor uso de memoria.
Hugging Face Transformers es un marco de definición de modelos para aprendizaje automático en tareas de texto, visión, audio y multimodales. Proporciona una API unificada para inferencia y entrenamiento con más de 1 millón de checkpoints preentrenados.
SenseVoiceSmall es un modelo fundacional de voz de código abierto para ASR, identificación de idioma, reconocimiento de emociones y detección de eventos de audio, que cubre mandarín, cantonés, inglés, japonés y coreano con inferencia no autorregresiva rápida.