Sobre o projeto

FluidAudio é um SDK Swift projetado pela Fluid Inference para construir aplicações de IA de áudio totalmente locais e de baixa latência em iOS e macOS. Ele aproveita o Neural Engine (ANE) da Apple para executar modelos de código aberto de última geração com alta eficiência e baixo consumo de energia. Principais recursos: - Reconhecimento Automático de Fala (ASR): Suporta transcrição em streaming e em lote usando modelos como Parakeet TDT, SenseVoice e Paraformer em mais de 25 idiomas, incluindo inglês, línguas europeias, japonês e mandarim. - Texto para Fala (TTS): Oferece síntese de voz de alta qualidade com Kokoro (9 idiomas), PocketTTS (streaming com clonagem de voz) e Chatterbox Multilingual/Nano (18 idiomas, tags paralinguísticas). - Diarização de Locutores: Fornece pipelines de streaming online e em lote offline para separação e identificação de falantes, utilizando modelos Sortformer e PyanNote. - Detecção de Atividade de Voz (VAD): Modelos Silero integrados para detecção eficiente de voz. - Extração de Embeddings de Locutor: Gera embeddings para comparação e agrupamento de vozes. - Offline e Privado: Processamento completo no dispositivo, sem dependência de nuvem, garantindo a privacidade do usuário. Inclui modo somente offline e configurações personalizadas de registro/proxy para ambientes isolados. - Wrappers multiplataforma: Wrappers oficiais disponíveis para React Native/Expo e Rust/Tauri. O SDK é integrado por vários aplicativos para ditado, transcrição de reuniões, controle de produção ao vivo e assistentes de voz, enfatizando privacidade, velocidade e facilidade de uso com apenas algumas linhas de código Swift.