Об этом проекте

WhisperLiveKit (WLK) — это open-source, self-hosted конвейер распознавания речи в текст, разработанный для ультра-низкой задержки в реальном времени. Его можно установить через pip, и он предоставляет командную строку для запуска сервера, транскрипции аудиофайлов, генерации SRT-субтитров и управления моделями. Набор включает несколько стратегий потоковой обработки речи и бэкендов, в том числе: - Модели семейства Whisper через Faster-Whisper, MLX или vanilla Whisper. - Voxtral Mini для многоязычного распознавания речи с определением языка на чанк. - FunASR SenseVoiceSmall для определённых языков. - Qwen3-ASR для потоковой транскрипции, включая каузальный режим с постоянными вычислениями на аудио-чанк. - NVIDIA Canary-1b-v2 через NeMo для европейских языков. WLK поддерживает одновременный перевод на 200 языков и с них с помощью NLLW или Alignatt4LLM. Также предусмотрена диаризация говорящих в реальном времени через Streaming Sortformer или Diart. Сервер предоставляет нативную WebSocket-точку для потоковой передачи в реальном времени, а также REST- и WebSocket-API, совместимые с OpenAI и Deepgram. Поддерживаются несколько одновременных пользователей, обнаружение речевой активности (VAD) для снижения нагрузки и параметры на сессию: язык, цель перевода, терминологический контекст и режим протокола. В репозитории есть встроенный веб-интерфейс, расширение Chrome для захвата веб-аудио и нативный macOS-клиент на SwiftUI.