SpeechRecognition 是一个 Python 语音识别库,支持多种在线和离线引擎与 API,包括 CMU Sphinx、Google、Azure、IBM、Vosk、Whisper 和 OpenAI。
OPEN SOURCE, OPEN TO EVERYONE
好开源,值得被发现。
发现优质开源项目,匿名提交开源项目,认领编辑你的开源项目。
✳人工精选 · 发现好开源4109已发现
带着好奇心,发现开源世界。
THE FIRST COLLECTIONTopic: speech-recognition清除
speech_recognitionUberi
新收录premove-itnpremove-ai
新收录Premove ITN 是一个面向英语语音代理转录的开源、上下文感知逆文本规范化工具。它通过生成-评分-解码流程,利用 DeBERTa 上下文评分,将口语化 ASR 输出转换为规范书面形式。
transformershuggingface
Hugging Face Transformers 是一个适用于文本、视觉、音频和多模态机器学习任务的模型定义框架。它提供统一的 API 用于推理和训练,并支持超过 100 万个预训练检查点。
sensevoiceQwenAudio
新收录SenseVoiceSmall 是一个开源语音基础模型,支持 ASR、语种识别、情感识别和音频事件检测,覆盖中文、粤语、英语、日语和韩语,并具备快速非自回归推理能力。
espnetespnet
新收录ESPnet 是一个基于 PyTorch 构建的端到端语音处理工具包,涵盖 ASR、TTS、语音翻译、增强、说话人分离等任务,提供可复现的配方和预训练模型。
whisperlivekitQuentinFuxa
新收录WhisperLiveKit (WLK) 是一个开源、自托管的超低延迟实时语音转文本管道,支持 Whisper 系列模型、Voxtral Mini、FunASR SenseVoiceSmall、Qwen3-ASR 和 NVIDIA Canary-1b-v2 等多种后端,提供实时转录、说话人分离及 200 种语言的翻译功能。
talkbank-toolsFranklinChen
新收录Batchalign3 是 TalkBank 的音频和机器学习流水线,用于生成和丰富 CHAT 转录文本,涵盖 ASR、强制对齐、神经词法标注、翻译和话语切分。它提供了 CLI、Python 包、PyO3 桥接、React 仪表板和一个实验性的 Tauri 桌面外壳。