OPEN SOURCE, OPEN TO EVERYONE

Código abierto. Nuevas posibilidades.

Descubre proyectos de código abierto de calidad, envía proyectos de forma anónima y reclama y edita tu propio proyecto.

Selección editorial · Descubre buen código abierto4109descubiertos

Un poco de curiosidad. Un mundo de código abierto.

THE FIRST COLLECTION
Topic: speech-recognition清除
espnetespnet
NUEVO

ESPnet es una herramienta de procesamiento de voz end-to-end basada en PyTorch que cubre ASR, TTS, traducción y más. Ofrece recetas reproducibles, cientos de modelos preentrenados y soporte para múltiples tareas como reconocimiento, síntesis y diarización.

IADesarrolloModel runtime
whisperlivekitQuentinFuxa
NUEVO

WhisperLiveKit (WLK) es un sistema de voz a texto de código abierto y autoalojado diseñado para transcripción en tiempo real de ultra baja latencia. Soporta múltiples modelos y provides APIs compatibles con OpenAI y Deepgram.

IADesarrolloModel runtime
talkbank-toolsFranklinChen
NUEVO

Batchalign3 es un pipeline de audio y ML de TalkBank para producir y enriquecer transcripciones CHAT, que cubre ASR, alineación forzada, morfoetiquetado neuronal, traducción y segmentación de enunciados. Incluye una CLI, paquete de Python, puente PyO3, panel de React y un shell de escritorio Tauri experimental.

IADesarrolloModel runtime

SpeechRecognition es una biblioteca de Python para reconocimiento de voz compatible con múltiples motores y API, tanto en línea como fuera de línea, incluidos CMU Sphinx, Google, Azure, IBM, Vosk, Whisper y OpenAI.

IADesarrolloMultimodal AI
mimoravikonix
NUEVO

Mimora is a free, fully local pronunciation trainer for English and Spanish. It uses on-device TTS, speech recognition, and a local LLM to generate phrases and score user attempts with word-level feedback, requiring no cloud or API keys.

IAProductividadAI assistants
whisper.cppggml-org
NUEVO

Una implementación de C/C++ de alto rendimiento para la inferencia del modelo de reconocimiento automático de voz (ASR) Whisper de OpenAI, diseñada para un despliegue ligero y multiplataforma.

IAModel runtime
premove-itnpremove-ai
NUEVO

Premove ITN es una biblioteca de normalización inversa de texto (ITN) de código abierto y consciente del contexto para transcripciones de agentes de voz en inglés. Convierte la salida de ASR en formas escritas canónicas mediante un pipeline de generar-puntuar-decodificar con puntuación contextual DeBERTa. Alcanza un 99,50% de precisión semántica en su subconjunto de prueba.

IADesarrolloModel runtime
NUEVO

Una reimplementación rápida del modelo Whisper de OpenAI utilizando CTranslate2, que ofrece una mayor velocidad de transcripción y un menor uso de memoria.

IAModel runtime
transformershuggingface
NUEVO

Hugging Face Transformers es un marco de definición de modelos para aprendizaje automático en tareas de texto, visión, audio y multimodales. Proporciona una API unificada para inferencia y entrenamiento con más de 1 millón de checkpoints preentrenados.

IADesarrolloTraining & evaluation
sensevoiceQwenAudio
NUEVO

SenseVoiceSmall es un modelo fundacional de voz de código abierto para ASR, identificación de idioma, reconocimiento de emociones y detección de eventos de audio, que cubre mandarín, cantonés, inglés, japonés y coreano con inferencia no autorregresiva rápida.

IADesarrolloModel runtime