这个项目能做什么

FluidVoice 是一款面向 macOS 的开源语音转文字听写应用,定位为云端听写服务的本地替代方案。它基于 GPLv3 许可分发,可通过 Homebrew cask 或手动下载发行版安装。 核心功能是通过全局快捷键触发的语音转文字听写,文本通过辅助功能 API 直接插入任意应用。实时预览浮层会在你说话时显示转录内容,并针对 MacBook 提供刘海感知布局。 语音识别在设备端运行。支持的模型包括 Nemotron Speech 3.5 系列、Parakeet Flash、Parakeet TDT v3 和 v2、Cohere Transcribe、Apple Speech,以及从 Tiny 到 Large 的 Whisper 各尺寸。语言覆盖范围因模型而异:Parakeet TDT v3 覆盖 25 种语言,Cohere Transcribe 覆盖 14 种,Nemotron 约 40 种,Whisper 最多 99 种。大多数模型需要 Apple Silicon;Intel Mac 可通过 Whisper 获得支持。 除普通听写外,该应用还提供命令模式,可通过语音控制 Mac(启动应用、运行快捷指令、触发系统操作),以及写作模式,可在任意文本字段中撰写或重写文本。可选的 AI 增强功能可使用 OpenAI、Groq、自定义提供商或名为 Fluid Intelligence 的内置本地模型对转录文本进行后处理,后者可处理格式、大小写和清理,而无需将数据发送到设备之外。可按应用配置提示词集。 其他功能包括可选的本地音频历史记录(带预算控制和 ZIP 导出)、每日使用统计、自适应浅色/深色主题、菜单栏集成、带可选测试版通道的自动更新,以及可配置的浮层尺寸。该项目表示其遵循本地优先原则:除非明确启用云端 AI 提供商,否则语音、音频和转录文本都保留在设备上。默认会发送匿名每周活动分析数据,且可禁用。 要求为 macOS 15.0 或更高版本、麦克风访问权限、辅助功能权限,以及约 1 GB 磁盘空间用于语音模型(可选的 Fluid Intelligence 模型还需约 3.5 GB)。从源码构建使用 Xcode 和 Swift Package Manager;构建脚本支持签名和未签名构建,集成测试通过 xcodebuild 运行。README 指出 iOS 和 Windows 版本已列入计划,但尚未推出。