这个项目能做什么
EnviousWispr 是一款免费、开源的 macOS AI 听写与语音转文字应用,专为 Apple Silicon 打造,设计上完全在设备本地运行。音频在本地处理,绝不上传;无需账户或订阅,应用可离线使用。
核心流程:在任意应用中按下全局快捷键,说话,应用在本地转写,可选地用 LLM 润色文本,然后复制到剪贴板,并可自动粘贴到当前活动应用中。README 描述其转写时间低于一秒,启用 AI 润色时,从按键到粘贴的完整流程通常约一秒半。Silero VAD 检测到你停止说话并自动结束录音。快捷键模式包括按住说话、切换和免手操作(双击锁定以进行长篇听写)。
提供两种 ASR 引擎。Parakeet TDT v3(NVIDIA NeMo,通过 FluidAudio)是默认引擎,运行于 Apple 神经引擎,支持 25 种欧洲语言,需要约 460 MB 磁盘空间。WhisperKit(OpenAI Whisper Large v3 Turbo,通过 argmax)运行于 GPU,支持 99 种以上语言并具备自动语言检测,需要约 1.6 GB。两者都通过 CoreML 运行;首次启动时会下载并编译模型。
AI 润色是可选的,默认保持在设备本地。选项包括 EG-1,即项目自行微调的清理模型(约 2.9 GB,macOS 14+);Superwhisper 的 S1-mini(约 484 MB,偏重英语,带有 Tone、Structure 和 Context 风格设置);Apple Intelligence(macOS 26+,无需额外下载);以及 Ollama(本地或托管)。通过 OpenAI、Gemini 或 Claude 进行的云端润色采用自带密钥方式,仅发送文本,绝不发送音频。README 说明 EG-1 按其自身的模型许可证分发,而非应用的 GPLv3,并且是 Qwen3-4B-Instruct-2507 的微调衍生模型。
README 中的功能亮点包括:说话时在录音胶囊中实时预览文字;Escape Recovery,可将取消的听写文本保留 24 小时(仅文本,绝不保留音频);Snippets,可逐字粘贴已保存文本,并支持日期、时间或剪贴板填充;Transcribe a File,用于处理现有音频/视频(m4a、mp3、wav、aiff、caf、mp4、mov、flac),在可区分人声时支持说话人轮换;自定义词汇和词汇包,支持从通讯录导入;Quick Add,可在 macOS 任意位置保存更正后的拼写;按名称进行 emoji 听写;英语中数字、日期和金额的确定性格式化;带 All/Dictations/Transcripts 筛选的历史记录;菜单栏常驻;以及 Sparkle 自动更新。
README 还记录了可靠性方面的工作:关键路径(录音、转写、粘贴)与可选增强功能保持分离,因此润色或历史保存失败不会阻碍交付;多步粘贴路径会为抗拒标准粘贴的应用自动回退;引导流程需要辅助功能权限,并在权限被撤销时重新检查;语音引擎运行在应用内部而非单独的辅助进程,以避免空闲冻结。发布版本被描述为已签名、已公证并通过 Gatekeeper 检查。
要求为 macOS 14(Sonoma)或更高版本以及 Apple Silicon(M1 或更新)。安装方式为 Homebrew cask(saurabhav88/tap/enviouswispr)或下载 DMG;会请求麦克风、辅助功能以及(首次粘贴回退时)自动化的权限。从源码构建使用 Swift Package Manager 进行编译,而可运行的 .app 通过 Tuist 和 Xcode 构建引擎组装;发布 DMG 由脚本生成,需要完整的 Xcode 26+、mise 和 Tuist。
README 中的架构说明描述了流水线状态机(idle、recording、transcribing、polishing、complete)、Swift 6 严格并发与 actor 隔离、刻意分离的 Parakeet 和 WhisperKit 后端,以及一种“Heart & Limbs”模式,即关键路径永不失败,可选功能优雅降级。
隐私:音频在本地处理且不上传,不过本地恢复可能会临时保留音频。匿名产品分析(PostHog)和崩溃报告(Sentry)默认开启,均可在设置中分别禁用;崩溃报告不包含听写文本和音频。项目应用代码采用 GPLv3 许可,EG-1 模型权重则采用单独的社区模型许可证,限制再分发以及用于训练竞争模型。名称和标志为商标。
评论
0 人表达喜爱 · 满10人后显示 Deer Point
登录后参与讨论。