SpeechRecognition 是一个 Python 语音识别库,支持多种在线和离线引擎与 API,包括 CMU Sphinx、Google、Azure、IBM、Vosk、Whisper 和 OpenAI。
好开源,值得被发现。
发现优质开源项目,匿名提交开源项目,认领编辑你的开源项目。
带着好奇心,发现开源世界。
THE FIRST COLLECTIONMimora 是一个免费、完全本地的英语和西班牙语发音训练器。它使用设备上的 TTS、语音识别和本地 LLM 来生成短语,并为用户尝试提供带有单词级反馈的评分,无需云服务或 API 密钥。
这是一个针对 OpenAI Whisper 自动语音识别 (ASR) 模型的高性能 C/C++ 推理实现,旨在实现轻量级且跨平台的部署。
Premove ITN 是一个面向英语语音代理转录的开源、上下文感知逆文本规范化工具。它通过生成-评分-解码流程,利用 DeBERTa 上下文评分,将口语化 ASR 输出转换为规范书面形式。
faster-whisper 是使用 CTranslate2 推理引擎对 OpenAI Whisper 语音转文本模型的快速重新实现,旨在提高转录速度并降低内存占用。
Hugging Face Transformers 是一个适用于文本、视觉、音频和多模态机器学习任务的模型定义框架。它提供统一的 API 用于推理和训练,并支持超过 100 万个预训练检查点。
SenseVoiceSmall 是一个开源语音基础模型,支持 ASR、语种识别、情感识别和音频事件检测,覆盖中文、粤语、英语、日语和韩语,并具备快速非自回归推理能力。
ESPnet 是一个基于 PyTorch 构建的端到端语音处理工具包,涵盖 ASR、TTS、语音翻译、增强、说话人分离等任务,提供可复现的配方和预训练模型。
WhisperLiveKit (WLK) 是一个开源、自托管的超低延迟实时语音转文本管道,支持 Whisper 系列模型、Voxtral Mini、FunASR SenseVoiceSmall、Qwen3-ASR 和 NVIDIA Canary-1b-v2 等多种后端,提供实时转录、说话人分离及 200 种语言的翻译功能。
Batchalign3 是 TalkBank 的音频和机器学习流水线,用于生成和丰富 CHAT 转录文本,涵盖 ASR、强制对齐、神经词法标注、翻译和话语切分。它提供了 CLI、Python 包、PyO3 桥接、React 仪表板和一个实验性的 Tauri 桌面外壳。