O NVIDIA NeMo Speech é um framework PyTorch Apache-2.0 para criar, personalizar e implantar modelos de IA de fala, cobrindo reconhecimento automático de fala, texto-para-fala e LLMs de fala, com checkpoints pré-treinados e instalação via Docker/uv.
Código aberto. Novas possibilidades.
Descubra projetos open source de qualidade, envie projetos anonimamente e reivindique e edite seu próprio projeto.
Um pouco de curiosidade. Um mundo de código aberto.
THE FIRST COLLECTIONO ESPnet é um kit de ferramentas de processamento de fala de ponta a ponta baseado em PyTorch, cobrindo ASR, TTS, tradução de fala, aprimoramento, diarização e mais, com receitas reproduzíveis e modelos pré-treinados.
FunTTS é uma biblioteca de texto para fala com interface unificada, que suporta a alternância perfeita entre vários motores de TTS de código aberto, oferecendo geração de legendas, diálogos multi-personagens e processamento assíncrono.
Speech To Speech é um framework modular para construir agentes de voz com modelos open-source, organizando o pipeline em VAD, STT, LLM e TTS, com suporte a APIs openai, inferência local e baixa latência via WebSocket e WebRTC.
VoxCPM2 é um sistema de texto para fala sem tokenização com um modelo autoregressivo de difusão de 2B que suporta 30 idiomas, design de voz a partir de descrições de texto, clonagem de voz controlável e saída de áudio de 48 kHz.