프로젝트 소개
FluidAudio는 Fluid Inference가 설계한 Swift SDK로, iOS와 macOS에서 완전히 로컬로 실행되는 저지연 오디오 AI 애플리케이션을 구축하기 위한 것입니다. Apple Neural Engine(ANE)을 활용하여 최신 오픈소스 모델을 높은 효율성과 낮은 전력 소비로 실행합니다.
주요 기능:
- 자동 음성 인식(ASR): Parakeet TDT, SenseVoice, Paraformer와 같은 모델을 사용하여 스트리밍 및 배치 전사를 지원하며, 영어, 유럽 언어, 일본어, 중국어(만다린)를 포함한 25개 이상의 언어를 지원합니다.
- 텍스트-음성 변환(TTS): Kokoro(9개 언어), PocketTTS(음성 복제가 가능한 스트리밍), Chatterbox Multilingual/Nano(18개 언어, 준언어적 태그)를 통해 고품질 음성 합성을 제공합니다.
- 화자 분리: Sortformer 및 PyanNote 모델을 활용하여 온라인 스트리밍 및 오프라인 배치 파이프라인을 모두 제공하여 화자 분리 및 식별을 수행합니다.
- 음성 활동 감지(VAD): 효율적인 음성 감지를 위해 Silero 모델을 통합했습니다.
- 화자 임베딩 추출: 음성 비교 및 클러스터링을 위한 임베딩을 생성합니다.
- 오프라인 및 프라이빗: 클라우드 의존성 없이 완전한 온디바이스 처리를 통해 사용자 프라이버시를 보장합니다. 오프라인 전용 모드와 에어갭 환경을 위한 사용자 지정 레지스트리/프록시 구성을 포함합니다.
- 크로스 플랫폼 래퍼: React Native/Expo 및 Rust/Tauri용 공식 래퍼를 제공합니다.
이 SDK는 받아쓰기, 회의 전사, 라이브 프로덕션 제어, 음성 비서 등 다양한 앱에 통합되어 있으며, 몇 줄의 Swift 코드만으로 프라이버시, 속도, 사용 용이성을 강조합니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.