SenseVoiceSmall es un modelo fundacional de voz de código abierto para ASR, identificación de idioma, reconocimiento de emociones y detección de eventos de audio, que cubre mandarín, cantonés, inglés, japonés y coreano con inferencia no autorregresiva rápida.
Código abierto. Nuevas posibilidades.
Descubre proyectos de código abierto de calidad, envía proyectos de forma anónima y reclama y edita tu propio proyecto.
Un poco de curiosidad. Un mundo de código abierto.
THE FIRST COLLECTIONBatchalign3 es un pipeline de audio y ML de TalkBank para producir y enriquecer transcripciones CHAT, que cubre ASR, alineación forzada, morfoetiquetado neuronal, traducción y segmentación de enunciados. Incluye una CLI, paquete de Python, puente PyO3, panel de React y un shell de escritorio Tauri experimental.
Biblioteca de Python que obtiene transcripciones y subtítulos de YouTube sin necesidad de clave API ni navegador sin interfaz. Soporta múltiples idiomas, traducción y formatos de salida.
Premove ITN es una biblioteca de normalización inversa de texto (ITN) de código abierto y consciente del contexto para transcripciones de agentes de voz en inglés. Convierte la salida de ASR en formas escritas canónicas mediante un pipeline de generar-puntuar-decodificar con puntuación contextual DeBERTa. Alcanza un 99,50% de precisión semántica en su subconjunto de prueba.