O NVIDIA NeMo Speech é um framework PyTorch Apache-2.0 para criar, personalizar e implantar modelos de IA de fala, cobrindo reconhecimento automático de fala, texto-para-fala e LLMs de fala, com checkpoints pré-treinados e instalação via Docker/uv.
Código aberto. Novas possibilidades.
Descubra projetos open source de qualidade, envie projetos anonimamente e reivindique e edite seu próprio projeto.
Um pouco de curiosidade. Um mundo de código aberto.
THE FIRST COLLECTIONDouvo é um aplicativo leve de entrada por voz para macOS, voltado para Apple Silicon, que usa o reconhecimento de fala Doubao ASR com pós-processamento opcional por IA para limpeza, tradução e edição de texto selecionado.
Batchalign3 é uma pipeline de áudio e ML do TalkBank para produzir e enriquecer transcritos CHAT, cobrindo ASR, alinhamento forçado, morfotagging neural, tradução e segmentação de expressões.
Biblioteca Python que recupera transcrições e legendas de vídeos do YouTube sem necessidade de chave de API ou navegador headless. Suporta múltiplos idiomas, tradução e formatação de saída.
Mimora é um treinador de pronúncia gratuito e totalmente local para inglês e espanhol. Ele usa TTS on-device, reconhecimento de fala e um LLM local para gerar frases e pontuar tentativas do usuário com feedback de nível de palavra, sem exigir nuvem ou chaves de API.
Premove ITN é uma biblioteca de normalização inversa de texto (ITN) de código aberto e sensível ao contexto, projetada para transcrições de agentes de voz em inglês. Ela converte saídas de ASR em formas escritas canônicas usando um pipeline de geração, pontuação e decodificação com pontuação contextual DeBERTa.
SenseVoiceSmall é um modelo de fundação de fala de código aberto para ASR, identificação de idioma, reconhecimento de emoção e detecção de eventos de áudio, abrangendo mandarim, cantonês, inglês, japonês e coreano com inferência não autorregressiva rápida.