OPEN SOURCE, OPEN TO EVERYONE

Código aberto. Novas possibilidades.

Descubra projetos open source de qualidade, envie projetos anonimamente e reivindique e edite seu próprio projeto.

Seleção editorial · Descubra bons projetos open source4101descobertos

Um pouco de curiosidade. Um mundo de código aberto.

THE FIRST COLLECTION
Topic: speech-recognition清除
talkbank-toolsFranklinChen
NOVO

Batchalign3 é uma pipeline de áudio e ML do TalkBank para produzir e enriquecer transcritos CHAT, cobrindo ASR, alinhamento forçado, morfotagging neural, tradução e segmentação de expressões.

IADesenvolvimentoModel runtime

SpeechRecognition é uma biblioteca Python para reconhecimento de fala que suporta múltiplos motores e APIs, online e offline, incluindo CMU Sphinx, Google, Azure, IBM, Vosk, Whisper e OpenAI.

IADesenvolvimentoMultimodal AI
mimoravikonix
NOVO

Mimora é um treinador de pronúncia gratuito e totalmente local para inglês e espanhol. Ele usa TTS on-device, reconhecimento de fala e um LLM local para gerar frases e pontuar tentativas do usuário com feedback de nível de palavra, sem exigir nuvem ou chaves de API.

IAProdutividadeAI assistants
whisper.cppggml-org
NOVO

Uma implementação de alta performance em C/C++ para inferência do modelo de reconhecimento automático de fala (ASR) Whisper da OpenAI, projetada para implantação leve e multiplataforma.

IAModel runtime
premove-itnpremove-ai
NOVO

Premove ITN é uma biblioteca de normalização inversa de texto (ITN) de código aberto e sensível ao contexto, projetada para transcrições de agentes de voz em inglês. Ela converte saídas de ASR em formas escritas canônicas usando um pipeline de geração, pontuação e decodificação com pontuação contextual DeBERTa.

IADesenvolvimentoModel runtime
NOVO

Uma reimplementação rápida do modelo Whisper da OpenAI usando CTranslate2, oferecendo maior velocidade de transcrição e menor uso de memória.

IAModel runtime
transformershuggingface
NOVO

Hugging Face Transformers é um framework de definição de modelos para aprendizado de máquina em tarefas de texto, visão, áudio e multimodais. Oferece uma API unificada para inferência e treinamento com mais de 1 milhão de checkpoints pré-treinados.

IADesenvolvimentoTraining & evaluation
sensevoiceQwenAudio
NOVO

SenseVoiceSmall é um modelo de fundação de fala de código aberto para ASR, identificação de idioma, reconhecimento de emoção e detecção de eventos de áudio, abrangendo mandarim, cantonês, inglês, japonês e coreano com inferência não autorregressiva rápida.

IADesenvolvimentoModel runtime
espnetespnet
NOVO

O ESPnet é um kit de ferramentas de processamento de fala de ponta a ponta baseado em PyTorch, cobrindo ASR, TTS, tradução de fala, aprimoramento, diarização e mais, com receitas reproduzíveis e modelos pré-treinados.

IADesenvolvimentoModel runtime
whisperlivekitQuentinFuxa
NOVO

WhisperLiveKit é um pipeline de voz para texto auto-hospedado e de ultra-baixa latência. Oferece transcrição em tempo real, diarização de locutores e tradução através de APIs compatíveis com WebSocket e OpenAI/Deepgram.

IADesenvolvimentoModel runtime