Batchalign3 é uma pipeline de áudio e ML do TalkBank para produzir e enriquecer transcritos CHAT, cobrindo ASR, alinhamento forçado, morfotagging neural, tradução e segmentação de expressões.
Código aberto. Novas possibilidades.
Descubra projetos open source de qualidade, envie projetos anonimamente e reivindique e edite seu próprio projeto.
Um pouco de curiosidade. Um mundo de código aberto.
THE FIRST COLLECTIONSpeechRecognition é uma biblioteca Python para reconhecimento de fala que suporta múltiplos motores e APIs, online e offline, incluindo CMU Sphinx, Google, Azure, IBM, Vosk, Whisper e OpenAI.
Mimora é um treinador de pronúncia gratuito e totalmente local para inglês e espanhol. Ele usa TTS on-device, reconhecimento de fala e um LLM local para gerar frases e pontuar tentativas do usuário com feedback de nível de palavra, sem exigir nuvem ou chaves de API.
Uma implementação de alta performance em C/C++ para inferência do modelo de reconhecimento automático de fala (ASR) Whisper da OpenAI, projetada para implantação leve e multiplataforma.
Premove ITN é uma biblioteca de normalização inversa de texto (ITN) de código aberto e sensível ao contexto, projetada para transcrições de agentes de voz em inglês. Ela converte saídas de ASR em formas escritas canônicas usando um pipeline de geração, pontuação e decodificação com pontuação contextual DeBERTa.
Uma reimplementação rápida do modelo Whisper da OpenAI usando CTranslate2, oferecendo maior velocidade de transcrição e menor uso de memória.
Hugging Face Transformers é um framework de definição de modelos para aprendizado de máquina em tarefas de texto, visão, áudio e multimodais. Oferece uma API unificada para inferência e treinamento com mais de 1 milhão de checkpoints pré-treinados.
SenseVoiceSmall é um modelo de fundação de fala de código aberto para ASR, identificação de idioma, reconhecimento de emoção e detecção de eventos de áudio, abrangendo mandarim, cantonês, inglês, japonês e coreano com inferência não autorregressiva rápida.
O ESPnet é um kit de ferramentas de processamento de fala de ponta a ponta baseado em PyTorch, cobrindo ASR, TTS, tradução de fala, aprimoramento, diarização e mais, com receitas reproduzíveis e modelos pré-treinados.
WhisperLiveKit é um pipeline de voz para texto auto-hospedado e de ultra-baixa latência. Oferece transcrição em tempo real, diarização de locutores e tradução através de APIs compatíveis com WebSocket e OpenAI/Deepgram.