这个项目能做什么

WhisperLiveKit (WLK) 是一个专为超低延迟实时转录设计的开源、自托管语音转文本管道。它可通过 pip 安装,并提供命令行界面以启动服务器、转录音频文件、生成 SRT 字幕和管理模型。 该套件集成了多种流式语音处理策略和后端,包括: - 通过 Faster-Whisper、MLX 或 vanilla Whisper 的 Whisper 系列模型。 - 支持按分块语言检测的多语言语音识别 Voxtral Mini。 - 针对特定语言的 FunASR SenseVoiceSmall。 - 支持流式转录的 Qwen3-ASR,包括每种音频分块计算量恒定的因果模式。 - 通过 NeMo 面向欧洲语言的 NVIDIA Canary-1b-v2。 WLK 支持使用 NLLW 或 Alignatt4LLM 在 200 种语言之间进行双向同步翻译。它还通过 Streaming Sortformer 或 Diart 提供实时说话人分离功能。 该服务器提供了用于实时流式传输的原生 WebSocket 端点,以及兼容 OpenAI 的 REST API 和兼容 Deepgram 的 WebSocket API。它支持多用户并发、用于降低开销的语音活动检测(VAD),以及针对语言、翻译目标、术语上下文和协议模式的每会话参数。仓库中包含了捆绑的 Web UI、用于捕获网页音频的 Chrome 扩展程序,以及原生的 SwiftUI macOS 客户端。