Sobre o projeto
FluidAudio é um SDK Swift projetado pela Fluid Inference para construir aplicações de IA de áudio totalmente locais e de baixa latência em iOS e macOS. Ele aproveita o Neural Engine (ANE) da Apple para executar modelos de código aberto de última geração com alta eficiência e baixo consumo de energia.
Principais recursos:
- Reconhecimento Automático de Fala (ASR): Suporta transcrição em streaming e em lote usando modelos como Parakeet TDT, SenseVoice e Paraformer em mais de 25 idiomas, incluindo inglês, línguas europeias, japonês e mandarim.
- Texto para Fala (TTS): Oferece síntese de voz de alta qualidade com Kokoro (9 idiomas), PocketTTS (streaming com clonagem de voz) e Chatterbox Multilingual/Nano (18 idiomas, tags paralinguísticas).
- Diarização de Locutores: Fornece pipelines de streaming online e em lote offline para separação e identificação de falantes, utilizando modelos Sortformer e PyanNote.
- Detecção de Atividade de Voz (VAD): Modelos Silero integrados para detecção eficiente de voz.
- Extração de Embeddings de Locutor: Gera embeddings para comparação e agrupamento de vozes.
- Offline e Privado: Processamento completo no dispositivo, sem dependência de nuvem, garantindo a privacidade do usuário. Inclui modo somente offline e configurações personalizadas de registro/proxy para ambientes isolados.
- Wrappers multiplataforma: Wrappers oficiais disponíveis para React Native/Expo e Rust/Tauri.
O SDK é integrado por vários aplicativos para ditado, transcrição de reuniões, controle de produção ao vivo e assistentes de voz, enfatizando privacidade, velocidade e facilidade de uso com apenas algumas linhas de código Swift.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.