这个项目能做什么
FluidAudio是由Fluid Inference设计的Swift SDK,用于在iOS和macOS上构建完全本地、低延迟的音频AI应用。它利用Apple的神经引擎(ANE)高效运行最先进的开源模型,功耗低。
主要特性:
- 自动语音识别(ASR):支持流式和批量转录,使用Parakeet TDT、SenseVoice和Paraformer等模型,覆盖25种以上语言,包括英语、欧洲语言、日语和普通话。
- 文字转语音(TTS):提供高质量语音合成,支持Kokoro(9种语言)、PocketTTS(流式,带语音克隆)和Chatterbox多语言/纳米(18种语言,副语言标签)。
- 说话人分离:提供在线流式和离线批量管道,用于说话人分离和识别,利用Sortformer和PyanNote模型。
- 语音活动检测(VAD):集成Silero模型,实现高效语音检测。
- 说话人嵌入提取:生成嵌入,用于语音比较和聚类。
- 离线与隐私:完全设备端处理,无云依赖,确保用户隐私。包括仅离线模式和自定义注册表/代理配置,适用于气隙环境。
- 跨平台封装:提供React Native/Expo和Rust/Tauri的官方封装。
该SDK已被众多应用集成,用于听写、会议转录、现场制作控制和语音助手,强调隐私、速度和易用性,只需几行Swift代码即可集成。
评论
0 人表达喜爱 · 满10人后显示 Deer Point
登录后参与讨论。