这个项目能做什么
Inkwell 是一款免费、开源、本地优先的桌面听写应用,可直接在你的机器上将语音转换为文本。它以隐私为设计核心:音频在本地通过基于 CPU 的语音识别进行采集、重采样和转写,绝不上传。没有账户、没有遥测、没有分析。转写记录存储在本地 SQLite 数据库中。
主要功能包括:
- **随处听写**:使用全局热键(按住说话或切换)进行录音,转写后的文本会粘贴到当前聚焦的应用中。
- **本地语音识别**:通过 sherpa-onnx 提供五种模型,每种都针对不同语言、准确度和资源占用进行了优化。模型在首次使用时下载,并可在应用内切换。
- **样式格式化**:可选择 Formal、Casual 或 Relaxed 样式来控制大小写和标点,而不影响模型。
- **自定义词典**:修正模型识别错误的词,支持不区分大小写和词边界匹配。
- **片段**:触发短语可展开为完整文本,并支持 {date}、{time} 和 {clipboard} 等变量。
- **语音命令**:使用唤醒前缀加动作,例如“inkwell, scratch that”或“inkwell, formal mode”。
- **模式**:将样式、语音清理和 AI 润色打包,根据你正在输入的应用自动激活(例如在电子邮件中使用正式样式,在终端中使用小写)。适用于 macOS 和 Windows。
- **文件转写**:拖入音频或视频文件(MP3、WAV、FLAC、OGG、M4A、MP4、MKV 等)进行转写。
- **历史记录与导出**:可搜索、可编辑的转写历史,支持导出为 TXT、SRT、JSON 和 CSV。
- **统计**:听写字数、说话时间、连续天数、每日活动和模型使用情况,全部基于本地历史计算。
- **托盘与悬浮窗**:驻留在系统托盘中,并带有一个小型始终置顶的悬浮窗显示录音状态。
- **实时预览(可选)**:说话时在悬浮窗上看到文字出现,使用更快的辅助模型。
- **语音编辑**:选择文本,按住第二个热键,说出要更改的内容,重写内容将替换所选内容。需要 API 密钥。
- **语音清理**:在粘贴前移除“um”、“uh”和即时口吃。
- **AI 润色(可选)**:自带 API 密钥以清理语法和错误开头。支持 OpenAI、Groq、Anthropic、OpenRouter 或任何 OpenAI 兼容端点。
隐私是核心重点。音频永远不会离开机器。唯一的网络调用用于模型下载(来自 Hugging Face 和 GitHub)、更新检查(发送到 Cloudflare worker),以及当你使用 AI 润色或语音编辑时,将文本(绝不是音频)发送给你选择的提供商。API 密钥存储在操作系统钥匙串中。
Inkwell 采用 MIT 许可证,永久免费,没有付费层级或许可证密钥。它使用 Rust、Tauri v2、React 19、TypeScript、Tailwind v4 构建,并使用 sherpa-onnx 进行推理、Silero VAD 进行语音活动检测、cpal 进行音频采集、SQLite 存储历史记录。
安装:提供适用于 macOS(已签名并公证)、Windows(NSIS 安装程序或 MSI,尚未签名)和 Linux(AppImage 和 .deb,尽力支持)的预构建二进制文件。从源代码构建需要 Rust 和 Node.js。
Inkwell 非常适合希望获得可靠、私密且不依赖云端的听写用户,以及重视对数据的控制能力和自定义格式与命令能力的用户。
评论
0 人表达喜爱 · 满10人后显示 Deer Point
登录后参与讨论。