Sobre el proyecto

WhisperLiveKit (WLK) es una canalización de voz a texto de código abierto y autoalojada, diseñada para transcripción en tiempo real de ultra baja latencia. Se puede instalar mediante pip y proporciona una interfaz de línea de comandos para iniciar un servidor, transcribir archivos de audio, generar subtítulos SRT y gestionar modelos. El kit integra múltiples estrategias de procesamiento de voz en streaming y backends, incluyendo: - Modelos de la familia Whisper mediante Faster-Whisper, MLX o Whisper vanilla. - Voxtral Mini para reconocimiento de voz multilingüe con detección de idioma por segmento. - FunASR SenseVoiceSmall para idiomas específicos. - Qwen3-ASR para transcripción en streaming, incluyendo un modo causal para cómputo constante por segmento de audio. - NVIDIA Canary-1b-v2 mediante NeMo para idiomas europeos. WLK soporta traducción simultánea a y desde 200 idiomas usando NLLW o Alignatt4LLM. También cuenta con diarización de hablantes en tiempo real mediante Streaming Sortformer o Diart. El servidor expone un endpoint nativo WebSocket para streaming en tiempo real, junto con APIs REST compatibles con OpenAI y WebSockets compatibles con Deepgram. Soporta múltiples usuarios concurrentes, detección de actividad de voz (VAD) para reducir la sobrecarga, y parámetros por sesión para idioma, objetivo de traducción, contexto de terminología y modo de protocolo. El repositorio incluye una interfaz web integrada, una extensión de Chrome para capturar audio web y un cliente macOS nativo en SwiftUI.