Um plugin de LLM multimodal local para Unreal Engine 5 que oferece inferência offline para texto, fala para texto e texto para fala.
Código aberto. Novas possibilidades.
Descubra projetos open source de qualidade, envie projetos anonimamente e reivindique e edite seu próprio projeto.
Um pouco de curiosidade. Um mundo de código aberto.
THE FIRST COLLECTIONSpeech To Speech é um framework modular para construir agentes de voz com modelos open-source, organizando o pipeline em VAD, STT, LLM e TTS, com suporte a APIs openai, inferência local e baixa latência via WebSocket e WebRTC.
Douvo é um aplicativo leve de entrada por voz para macOS, voltado para Apple Silicon, que usa o reconhecimento de fala Doubao ASR com pós-processamento opcional por IA para limpeza, tradução e edição de texto selecionado.
Lexos é um mecanismo de processamento de documentos com IA orientado a eventos, combinando um gateway Go, workers Python, filas Redis e modelos auto-hospedados para RAG offline, sumarização e transcrição de fala.
SpeechRecognition é uma biblioteca Python para reconhecimento de fala que suporta múltiplos motores e APIs, online e offline, incluindo CMU Sphinx, Google, Azure, IBM, Vosk, Whisper e OpenAI.
Uma implementação de alta performance em C/C++ para inferência do modelo de reconhecimento automático de fala (ASR) Whisper da OpenAI, projetada para implantação leve e multiplataforma.
Bolo é um aplicativo de ditado push-to-talk para macOS, escrito em Rust, que transcreve fala em tempo real e cola o texto resultante em qualquer campo de texto ativo. Ele utiliza a API de fala-para-texto da Telnyx e oferece recursos como limpeza de texto por LLM, histórico de transcrições e suporte a vocabulário personalizado.
SkyClass Distill é uma ferramenta de pipeline que converte vídeos educacionais em Teaching Skills estruturadas, suportando a coleta de vídeos, transcrição, extração de evidências e destilação via LLM.
TypeNo é um app open-source para macOS que transcreve voz localmente e cola o texto instantaneamente — sem contas, sem configurações, focado na privacidade.
Velo AI Studio é uma ferramenta de criação de vídeo baseada em navegador e de código aberto, projetada para montar vídeos narrados a partir de roteiros, áudio e ativos visuais gerados por IA.
Uma reimplementação rápida do modelo Whisper da OpenAI usando CTranslate2, oferecendo maior velocidade de transcrição e menor uso de memória.
SenseVoiceSmall é um modelo de fundação de fala de código aberto para ASR, identificação de idioma, reconhecimento de emoção e detecção de eventos de áudio, abrangendo mandarim, cantonês, inglês, japonês e coreano com inferência não autorregressiva rápida.
LazyEdit é um fluxo de trabalho de vídeo local-first e assistido por IA para criação, processamento e publicação opcional de conteúdo de ponta a ponta.
Ferramenta open-source para tradução de vídeos com reconhecimento de fala, tradução de legendas, dublagem por IA e clonagem de voz, com suporte a implantação local e APIs online.
Handy é um aplicativo de desktop gratuito, de código aberto e multiplataforma para transcrição de fala, que funciona totalmente offline. Pressione um atalho, fale e obtenha o texto transcrito colado em qualquer campo, usando modelos Whisper ou Parakeet.
WhisperLiveKit é um pipeline de voz para texto auto-hospedado e de ultra-baixa latência. Oferece transcrição em tempo real, diarização de locutores e tradução através de APIs compatíveis com WebSocket e OpenAI/Deepgram.
Lamitype é um aplicativo gratuito, de código aberto e focado em privacidade para transcrição de fala em texto no macOS. Por padrão, executa localmente o modelo Qwen3-ASR no Apple Silicon, com saída em chinês tradicional, legendas em tempo real, tradução e revisão de texto, além de ditado em nuvem opcional.