这个项目能做什么

Voicebox 是一个开源的 AI 语音工作室,设计为在用户本地设备上运行,定位为 ElevenLabs 和 WisprFlow 等云服务的免费替代方案。它同时覆盖语音输出(文本转语音和语音克隆)与语音输入(语音转文字听写),并内置本地 LLM,可用于可选文本润色以及按配置文件设置的语音个性。 仓库中描述的主要能力包括: - **语音克隆与 TTS**:支持通过短参考样本进行零样本克隆,并提供 50 多个精选预设音色。内置七种 TTS 引擎(Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual、Chatterbox Turbo、HumeAI TADA 和 Kokoro),根据引擎不同最多支持 23 种语言。 - **语音转文字**:由本地运行的 OpenAI Whisper 提供支持,模型规模可从 Base 到 Turbo 选择,并通过 MLX 在 Apple Silicon 上运行,或通过 PyTorch 在 CUDA、ROCm、DirectML 及 CPU 上运行。 - **全局听写**:通过系统级快捷键,用户可在当前聚焦的任意文本字段中进行听写输入。README 提到其支持目标感知粘贴,在 macOS 上经过无障碍功能验证的输入注入,并提供首次运行时针对辅助功能与输入监控权限的引导体验。 - **音频后期处理**:基于 Spotify 的 pedalboard 库内置八种效果,包括变调、混响、延迟、合唱、压缩器、增益和滤波器,并支持可复用的预设。 - **智能体语音输出**:内置 MCP(Model Context Protocol)服务器,提供 `voicebox.speak`、`voicebox.transcribe`、`voicebox.list_captures` 和 `voicebox.list_profiles` 等工具。支持 MCP 的智能体(如 Claude Code、Cursor、Windsurf 和 Cline)可通过一次工具调用,以克隆语音向用户发声。 - **本地隐私**:模型、语音数据和捕获内容均保存在用户本地设备上。 - **Stories 编辑器**:提供多轨时间线,可用于对话、播客和叙事内容制作,支持拖拽编排与同步播放。 - **捕获管理**:听写内容、应用内录音和上传文件会同时保存音频与转录文本,并可重新转录、润色、编辑,或提升为语音样本。 - **API**:在 `http://127.0.0.1:17493` 提供 REST API,包含 `/generate`、`/speak`、`/transcribe` 和 `/profiles` 等接口,文档位于 `/docs`。 - **平台支持**:提供 macOS(Apple Silicon 与 Intel)和 Windows 的现成下载,同时支持 Docker,并为 Linux 提供源码构建说明。 技术方面,该桌面应用基于 Tauri(Rust)和 React/TypeScript 构建,后端使用 FastAPI Python,存储采用 SQLite,并根据平台和 GPU 情况使用 MLX 或 PyTorch 进行推理。README 中的路线图提到未来将改进 Windows/Linux 自动粘贴、增加更多 STT 引擎、流式转录、端到端语音 LLM 以及插件架构。该项目已在 GitHub 上发布,README 中标注了许可证徽章,仓库中也包含贡献指南。