OPEN SOURCE, OPEN TO EVERYONE

Código aberto. Novas possibilidades.

Descubra projetos open source de qualidade, envie projetos anonimamente e reivindique e edite seu próprio projeto.

Seleção editorial · Descubra bons projetos open source4109descobertos

Um pouco de curiosidade. Um mundo de código aberto.

THE FIRST COLLECTION
Topic: speech-recognition清除
espnetespnet
NOVO

O ESPnet é um kit de ferramentas de processamento de fala de ponta a ponta baseado em PyTorch, cobrindo ASR, TTS, tradução de fala, aprimoramento, diarização e mais, com receitas reproduzíveis e modelos pré-treinados.

IADesenvolvimentoModel runtime
whisperlivekitQuentinFuxa
NOVO

WhisperLiveKit é um pipeline de voz para texto auto-hospedado e de ultra-baixa latência. Oferece transcrição em tempo real, diarização de locutores e tradução através de APIs compatíveis com WebSocket e OpenAI/Deepgram.

IADesenvolvimentoModel runtime
talkbank-toolsFranklinChen
NOVO

Batchalign3 é uma pipeline de áudio e ML do TalkBank para produzir e enriquecer transcritos CHAT, cobrindo ASR, alinhamento forçado, morfotagging neural, tradução e segmentação de expressões.

IADesenvolvimentoModel runtime

SpeechRecognition é uma biblioteca Python para reconhecimento de fala que suporta múltiplos motores e APIs, online e offline, incluindo CMU Sphinx, Google, Azure, IBM, Vosk, Whisper e OpenAI.

IADesenvolvimentoMultimodal AI
premove-itnpremove-ai
NOVO

Premove ITN é uma biblioteca de normalização inversa de texto (ITN) de código aberto e sensível ao contexto, projetada para transcrições de agentes de voz em inglês. Ela converte saídas de ASR em formas escritas canônicas usando um pipeline de geração, pontuação e decodificação com pontuação contextual DeBERTa.

IADesenvolvimentoModel runtime
transformershuggingface
NOVO

Hugging Face Transformers é um framework de definição de modelos para aprendizado de máquina em tarefas de texto, visão, áudio e multimodais. Oferece uma API unificada para inferência e treinamento com mais de 1 milhão de checkpoints pré-treinados.

IADesenvolvimentoTraining & evaluation
sensevoiceQwenAudio
NOVO

SenseVoiceSmall é um modelo de fundação de fala de código aberto para ASR, identificação de idioma, reconhecimento de emoção e detecção de eventos de áudio, abrangendo mandarim, cantonês, inglês, japonês e coreano com inferência não autorregressiva rápida.

IADesenvolvimentoModel runtime