OPEN SOURCE, OPEN TO EVERYONE

Código aberto. Novas possibilidades.

Descubra projetos open source de qualidade, envie projetos anonimamente e reivindique e edite seu próprio projeto.

Seleção editorial · Descubra bons projetos open source4083descobertos

Um pouco de curiosidade. Um mundo de código aberto.

THE FIRST COLLECTION
Topic: asr清除
speechNVIDIA-NeMo
NOVO

O NVIDIA NeMo Speech é um framework PyTorch Apache-2.0 para criar, personalizar e implantar modelos de IA de fala, cobrindo reconhecimento automático de fala, texto-para-fala e LLMs de fala, com checkpoints pré-treinados e instalação via Docker/uv.

IAMúsicaModel runtime
douvorhinoc
NOVO

Douvo é um aplicativo leve de entrada por voz para macOS, voltado para Apple Silicon, que usa o reconhecimento de fala Doubao ASR com pós-processamento opcional por IA para limpeza, tradução e edição de texto selecionado.

ProdutividadeIAUtilities
talkbank-toolsFranklinChen
NOVO

Batchalign3 é uma pipeline de áudio e ML do TalkBank para produzir e enriquecer transcritos CHAT, cobrindo ASR, alinhamento forçado, morfotagging neural, tradução e segmentação de expressões.

IADesenvolvimentoModel runtime

Biblioteca Python que recupera transcrições e legendas de vídeos do YouTube sem necessidade de chave de API ou navegador headless. Suporta múltiplos idiomas, tradução e formatação de saída.

DesenvolvimentoBackend & APIs
mimoravikonix
NOVO

Mimora é um treinador de pronúncia gratuito e totalmente local para inglês e espanhol. Ele usa TTS on-device, reconhecimento de fala e um LLM local para gerar frases e pontuar tentativas do usuário com feedback de nível de palavra, sem exigir nuvem ou chaves de API.

IAProdutividadeAI assistants
premove-itnpremove-ai
NOVO

Premove ITN é uma biblioteca de normalização inversa de texto (ITN) de código aberto e sensível ao contexto, projetada para transcrições de agentes de voz em inglês. Ela converte saídas de ASR em formas escritas canônicas usando um pipeline de geração, pontuação e decodificação com pontuação contextual DeBERTa.

IADesenvolvimentoModel runtime
sensevoiceQwenAudio
NOVO

SenseVoiceSmall é um modelo de fundação de fala de código aberto para ASR, identificação de idioma, reconhecimento de emoção e detecção de eventos de áudio, abrangendo mandarim, cantonês, inglês, japonês e coreano com inferência não autorregressiva rápida.

IADesenvolvimentoModel runtime