Sobre el proyecto
FluidAudio es un SDK de Swift diseñado por Fluid Inference para crear aplicaciones de audio AI completamente locales y de baja latencia en iOS y macOS. Aprovecha el Neural Engine (ANE) de Apple para ejecutar modelos de código abierto de última generación con alta eficiencia y bajo consumo de energía.
Características clave:
- Reconocimiento automático del habla (ASR): Admite transcripción en streaming y por lotes con modelos como Parakeet TDT, SenseVoice y Paraformer en más de 25 idiomas, incluidos inglés, idiomas europeos, japonés y chino mandarín.
- Texto a voz (TTS): Ofrece síntesis de voz de alta calidad con Kokoro (9 idiomas), PocketTTS (streaming con clonación de voz) y Chatterbox Multilingüe/Nano (18 idiomas, etiquetas paralingüísticas).
- Diarización de hablantes: Proporciona pipelines tanto de streaming en línea como por lotes fuera de línea para la separación e identificación de hablantes, utilizando modelos Sortformer y PyanNote.
- Detección de actividad de voz (VAD): Modelos Silero integrados para una detección de voz eficiente.
- Extracción de embeddings de hablante: Genera embeddings para comparación y agrupación de voces.
- Fuera de línea y privado: Procesamiento completamente en el dispositivo sin dependencia de la nube, garantizando la privacidad del usuario. Incluye modo solo fuera de línea y configuraciones personalizadas de registro/proxy para entornos aislados.
- Wrappers multiplataforma: Wrappers oficiales disponibles para React Native/Expo y Rust/Tauri.
El SDK es integrado por numerosas aplicaciones para dictado, transcripción de reuniones, control de producción en vivo y asistentes de voz, enfatizando privacidad, velocidad y facilidad de uso con solo unas pocas líneas de código Swift.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.