À propos du projet
FluidAudio est un SDK Swift conçu par Fluid Inference pour créer des applications d'IA audio entièrement locales et à faible latence sur iOS et macOS. Il exploite le moteur neuronal d'Apple (ANE) pour exécuter des modèles open-source de pointe avec une efficacité élevée et une faible consommation d'énergie.
Caractéristiques clés :
- Reconnaissance automatique de la parole (ASR) : prend en charge la transcription en streaming et par lots à l'aide de modèles comme Parakeet TDT, SenseVoice et Paraformer dans plus de 25 langues, y compris l'anglais, les langues européennes, le japonais et le mandarin.
- Synthèse vocale (TTS) : offre une synthèse vocale de haute qualité avec Kokoro (9 langues), PocketTTS (streaming avec clonage vocal) et Chatterbox Multilingue/Nano (18 langues, balises paralinguistiques).
- Diarisation des locuteurs : fournit des pipelines de streaming en ligne et par lots hors ligne pour la séparation et l'identification des locuteurs, utilisant les modèles Sortformer et PyanNote.
- Détection d'activité vocale (VAD) : modèles Silero intégrés pour une détection vocale efficace.
- Extraction d'empreintes vocales : génère des empreintes pour la comparaison et le regroupement de voix.
- Hors ligne et privé : traitement entièrement sur l'appareil sans dépendance au cloud, garantissant la confidentialité des utilisateurs. Inclut un mode hors ligne uniquement et des configurations personnalisées de registre/proxy pour les environnements isolés.
- Wrappers multiplateformes : wrappers officiels disponibles pour React Native/Expo et Rust/Tauri.
Le SDK est intégré par de nombreuses applications pour la dictée, la transcription de réunions, le contrôle de production en direct et les assistants vocaux, mettant l'accent sur la confidentialité, la rapidité et la facilité d'utilisation avec seulement quelques lignes de code Swift.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.