OPEN SOURCE, OPEN TO EVERYONE

好开源,值得被发现。

发现优质开源项目,匿名提交开源项目,认领编辑你的开源项目。

人工精选 · 发现好开源4109已发现

带着好奇心,发现开源世界。

THE FIRST COLLECTION
Topic: speech-recognition清除
新收录

SpeechRecognition 是一个 Python 语音识别库,支持多种在线和离线引擎与 API,包括 CMU Sphinx、Google、Azure、IBM、Vosk、Whisper 和 OpenAI。

人工智能开发工具图像 / 音视频 AI
mimoravikonix
新收录

Mimora 是一个免费、完全本地的英语和西班牙语发音训练器。它使用设备上的 TTS、语音识别和本地 LLM 来生成短语,并为用户尝试提供带有单词级反馈的评分,无需云服务或 API 密钥。

人工智能效率办公AI 助手
whisper.cppggml-org
新收录

这是一个针对 OpenAI Whisper 自动语音识别 (ASR) 模型的高性能 C/C++ 推理实现,旨在实现轻量级且跨平台的部署。

人工智能模型运行与推理
premove-itnpremove-ai
新收录

Premove ITN 是一个面向英语语音代理转录的开源、上下文感知逆文本规范化工具。它通过生成-评分-解码流程,利用 DeBERTa 上下文评分,将口语化 ASR 输出转换为规范书面形式。

人工智能开发工具模型运行与推理
新收录

faster-whisper 是使用 CTranslate2 推理引擎对 OpenAI Whisper 语音转文本模型的快速重新实现,旨在提高转录速度并降低内存占用。

人工智能模型运行与推理
transformershuggingface
新收录

Hugging Face Transformers 是一个适用于文本、视觉、音频和多模态机器学习任务的模型定义框架。它提供统一的 API 用于推理和训练,并支持超过 100 万个预训练检查点。

人工智能开发工具训练 / 微调 / 评测
sensevoiceQwenAudio
新收录

SenseVoiceSmall 是一个开源语音基础模型,支持 ASR、语种识别、情感识别和音频事件检测,覆盖中文、粤语、英语、日语和韩语,并具备快速非自回归推理能力。

人工智能开发工具模型运行与推理
espnetespnet
新收录

ESPnet 是一个基于 PyTorch 构建的端到端语音处理工具包,涵盖 ASR、TTS、语音翻译、增强、说话人分离等任务,提供可复现的配方和预训练模型。

人工智能开发工具模型运行与推理
whisperlivekitQuentinFuxa
新收录

WhisperLiveKit (WLK) 是一个开源、自托管的超低延迟实时语音转文本管道,支持 Whisper 系列模型、Voxtral Mini、FunASR SenseVoiceSmall、Qwen3-ASR 和 NVIDIA Canary-1b-v2 等多种后端,提供实时转录、说话人分离及 200 种语言的翻译功能。

人工智能开发工具模型运行与推理
talkbank-toolsFranklinChen
新收录

Batchalign3 是 TalkBank 的音频和机器学习流水线,用于生成和丰富 CHAT 转录文本,涵盖 ASR、强制对齐、神经词法标注、翻译和话语切分。它提供了 CLI、Python 包、PyO3 桥接、React 仪表板和一个实验性的 Tauri 桌面外壳。

人工智能开发工具模型运行与推理