douvorhinoc
新收录Douvo是一款面向Apple Silicon Mac的轻量级macOS语音输入应用,使用豆包ASR引擎,支持本地或远程AI后处理,用于文本清理、翻译和选中文本编辑。
发现优质开源项目,匿名提交开源项目,认领编辑你的开源项目。
带着好奇心,发现开源世界。
THE FIRST COLLECTIONDouvo是一款面向Apple Silicon Mac的轻量级macOS语音输入应用,使用豆包ASR引擎,支持本地或远程AI后处理,用于文本清理、翻译和选中文本编辑。
Batchalign3 是 TalkBank 的音频和机器学习流水线,用于生成和丰富 CHAT 转录文本,涵盖 ASR、强制对齐、神经词法标注、翻译和话语切分。它提供了 CLI、Python 包、PyO3 桥接、React 仪表板和一个实验性的 Tauri 桌面外壳。
YouTube Transcript API 是一个用于获取 YouTube 视频字幕和转录文本的 Python 库,无需 API 密钥或无头浏览器。支持多种语言、翻译及多种输出格式。
Mimora 是一个免费、完全本地的英语和西班牙语发音训练器。它使用设备上的 TTS、语音识别和本地 LLM 来生成短语,并为用户尝试提供带有单词级反馈的评分,无需云服务或 API 密钥。
Premove ITN 是一个面向英语语音代理转录的开源、上下文感知逆文本规范化工具。它通过生成-评分-解码流程,利用 DeBERTa 上下文评分,将口语化 ASR 输出转换为规范书面形式。
SenseVoiceSmall 是一个开源语音基础模型,支持 ASR、语种识别、情感识别和音频事件检测,覆盖中文、粤语、英语、日语和韩语,并具备快速非自回归推理能力。
NVIDIA NeMo Speech 是一个 Apache-2.0 许可的 PyTorch 框架,用于构建、定制和部署语音 AI 模型,涵盖自动语音识别、文本转语音和语音大语言模型,并提供预训练检查点及 Docker/uv 安装方式。