Sobre o projeto
WhisperLiveKit (WLK) é um pipeline open-source de transcrição de voz para texto, auto-hospedado e projetado para latência extremamente baixa em tempo real. Pode ser instalado via pip e disponibiliza uma interface de linha de comando para iniciar um servidor, transcrever arquivos de áudio, gerar legendas no formato SRT e gerenciar modelos.
O kit integra múltiplas estratégias e backends de processamento de fala em streaming, incluindo:
- Modelos da família Whisper através do Faster-Whisper, MLX ou Whisper padrão.
- Voxtral Mini para reconhecimento de fala multilíngue com detecção de idioma por bloco.
- FunASR SenseVoiceSmall para idiomas específicos.
- Qwen3-ASR para transcrição em streaming, incluindo um modo causal que mantém cálculo constante por bloco de áudio.
- NVIDIA Canary-1b-v2 via NeMo para idiomas europeus.
O WLK suporta tradução simultânea para e a partir de 200 idiomas, utilizando NLLW ou Alignatt4LLM. Também oferece diarização de locutores em tempo real por meio do Streaming Sortformer ou Diart.
O servidor expõe um endpoint nativo WebSocket para streaming em tempo real, além de APIs REST compatíveis com OpenAI e WebSocket compatíveis com Deepgram. Suporta múltiplos usuários concurrentes, detecção de atividade de voz (VAD) para reduzir sobrecarga, e parâmetros por sessão para idioma, idioma alvo de tradução, contexto de terminologia e modo de protocolo. O repositório inclui uma interface web integrada, uma extensão para Chrome para captura de áudio da web e um cliente nativo SwiftUI para macOS.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.