SenseVoiceSmall 是一个开源语音基础模型,支持 ASR、语种识别、情感识别和音频事件检测,覆盖中文、粤语、英语、日语和韩语,并具备快速非自回归推理能力。
好开源,值得被发现。
发现优质开源项目,匿名提交开源项目,认领编辑你的开源项目。
带着好奇心,发现开源世界。
THE FIRST COLLECTIONLazyEdit 是一个本地优先、AI 辅助的视频工作流,旨在实现从内容创作、处理到可选发布的端到端流程。
pyVideoTrans是一款支持本地离线部署与各类在线API的开源工具,可用于视频翻译、音频转录、AI配音及字幕翻译。
Handy 是一款免费、开源、跨平台的离线语音转文字桌面应用。按下快捷键说话,即可将转录文本粘贴到任意输入框,支持 Whisper 和 Parakeet 模型。
WhisperLiveKit (WLK) 是一个开源、自托管的超低延迟实时语音转文本管道,支持 Whisper 系列模型、Voxtral Mini、FunASR SenseVoiceSmall、Qwen3-ASR 和 NVIDIA Canary-1b-v2 等多种后端,提供实时转录、说话人分离及 200 种语言的翻译功能。
Lamitype 是一款免費、開源、隱私優先的 macOS 語音轉文字 App,預設在 Apple Silicon 上本地執行 Qwen3-ASR 模型,支援繁體中文優先輸出、即時字幕、文字翻譯與校對,並提供可選的雲端聽寫功能。
这是一个为 Unreal Engine 5 提供的本地多模态 LLM 插件,支持文本、语音转文本(STT)和文本转语音(TTS)的离线推理。
Speech To Speech 是一个基于开源模型的模块化语音代理框架,通过 VAD、STT、LLM 和 TTS 四个可插拔阶段构建语音交互管道,支持本地、混合及远程部署,并提供低延迟的 OpenAI Realtime API 兼容接口。
Douvo是一款面向Apple Silicon Mac的轻量级macOS语音输入应用,使用豆包ASR引擎,支持本地或远程AI后处理,用于文本清理、翻译和选中文本编辑。
Lexos是一个事件驱动的AI文档处理引擎,结合Go网关、Python工作器、Redis队列和自托管模型,实现离线RAG、摘要和语音转录。
SpeechRecognition 是一个 Python 语音识别库,支持多种在线和离线引擎与 API,包括 CMU Sphinx、Google、Azure、IBM、Vosk、Whisper 和 OpenAI。
这是一个针对 OpenAI Whisper 自动语音识别 (ASR) 模型的高性能 C/C++ 推理实现,旨在实现轻量级且跨平台的部署。
Bolo 是一款免费的自托管 macOS 语音转文本应用,由 Rust 编写:按住热键说话,转录结果通过 Telnyx AI 粘贴到光标处,并支持可选的 LLM 清理和本地转录历史。
空中课堂蒸馏 (SkyClass Distill) 是一个将教学视频转化为结构化教学技能 (Teaching Skills) 的流水线工具,支持视频采集、转写、证据提取及 LLM 蒸馏。
TypeNo是一款轻量级、注重隐私的macOS语音转文字工具,可在本地快速转录语音并即时粘贴,无需账户、设置或云端处理。
Velo AI Studio 是一款开源的基于浏览器的视频创作工具,旨在通过脚本、音频和 AI 生成的视觉资产来组装旁白视频。
faster-whisper 是使用 CTranslate2 推理引擎对 OpenAI Whisper 语音转文本模型的快速重新实现,旨在提高转录速度并降低内存占用。