Sobre el proyecto
WhisperLiveKit (WLK) es una canalización de voz a texto de código abierto y autoalojada, diseñada para transcripción en tiempo real de ultra baja latencia. Se puede instalar mediante pip y proporciona una interfaz de línea de comandos para iniciar un servidor, transcribir archivos de audio, generar subtítulos SRT y gestionar modelos.
El kit integra múltiples estrategias de procesamiento de voz en streaming y backends, incluyendo:
- Modelos de la familia Whisper mediante Faster-Whisper, MLX o Whisper vanilla.
- Voxtral Mini para reconocimiento de voz multilingüe con detección de idioma por segmento.
- FunASR SenseVoiceSmall para idiomas específicos.
- Qwen3-ASR para transcripción en streaming, incluyendo un modo causal para cómputo constante por segmento de audio.
- NVIDIA Canary-1b-v2 mediante NeMo para idiomas europeos.
WLK soporta traducción simultánea a y desde 200 idiomas usando NLLW o Alignatt4LLM. También cuenta con diarización de hablantes en tiempo real mediante Streaming Sortformer o Diart.
El servidor expone un endpoint nativo WebSocket para streaming en tiempo real, junto con APIs REST compatibles con OpenAI y WebSockets compatibles con Deepgram. Soporta múltiples usuarios concurrentes, detección de actividad de voz (VAD) para reducir la sobrecarga, y parámetros por sesión para idioma, objetivo de traducción, contexto de terminología y modo de protocolo. El repositorio incluye una interfaz web integrada, una extensión de Chrome para capturar audio web y un cliente macOS nativo en SwiftUI.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.