Об этом проекте
WhisperLiveKit (WLK) — это open-source, self-hosted конвейер распознавания речи в текст, разработанный для ультра-низкой задержки в реальном времени. Его можно установить через pip, и он предоставляет командную строку для запуска сервера, транскрипции аудиофайлов, генерации SRT-субтитров и управления моделями.
Набор включает несколько стратегий потоковой обработки речи и бэкендов, в том числе:
- Модели семейства Whisper через Faster-Whisper, MLX или vanilla Whisper.
- Voxtral Mini для многоязычного распознавания речи с определением языка на чанк.
- FunASR SenseVoiceSmall для определённых языков.
- Qwen3-ASR для потоковой транскрипции, включая каузальный режим с постоянными вычислениями на аудио-чанк.
- NVIDIA Canary-1b-v2 через NeMo для европейских языков.
WLK поддерживает одновременный перевод на 200 языков и с них с помощью NLLW или Alignatt4LLM. Также предусмотрена диаризация говорящих в реальном времени через Streaming Sortformer или Diart.
Сервер предоставляет нативную WebSocket-точку для потоковой передачи в реальном времени, а также REST- и WebSocket-API, совместимые с OpenAI и Deepgram. Поддерживаются несколько одновременных пользователей, обнаружение речевой активности (VAD) для снижения нагрузки и параметры на сессию: язык, цель перевода, терминологический контекст и режим протокола. В репозитории есть встроенный веб-интерфейс, расширение Chrome для захвата веб-аудио и нативный macOS-клиент на SwiftUI.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.