このプロジェクトについて

FluidAudioは、Fluid Inferenceが設計したSwift SDKで、iOSおよびmacOS上で完全にローカルかつ低遅延の音声AIアプリケーションを構築するためのものです。AppleのNeural Engine(ANE)を活用し、最先端のオープンソースモデルを高効率かつ低消費電力で実行します。 主な機能: - 自動音声認識(ASR):Parakeet TDT、SenseVoice、Paraformerなどのモデルを使用し、英語、欧州言語、日本語、中国語(北京語)を含む25以上の言語で、ストリーミングおよびバッチ転写をサポートします。 - 音声合成(TTS):Kokoro(9言語)、PocketTTS(音声クローニング対応のストリーミング)、Chatterbox Multilingual/Nano(18言語、パラ言語タグ)による高品質な音声合成を提供します。 - 話者分離:SortformerおよびPyanNoteモデルを利用し、オンラインストリーミングとオフラインバッチの両方のパイプラインで、話者の分離と識別を提供します。 - 音声アクティビティ検出(VAD):効率的な音声検出のためにSileroモデルを統合しています。 - 話者埋め込み抽出:音声比較およびクラスタリング用の埋め込みを生成します。 - オフライン&プライベート:クラウド依存なしの完全なオンデバイス処理により、ユーザーのプライバシーを確保します。オフライン専用モードと、エアギャップ環境向けのカスタムレジストリ/プロキシ設定が含まれます。 - クロスプラットフォームラッパー:React Native/ExpoおよびRust/Tauri用の公式ラッパーが利用可能です。 このSDKは、ディクテーション、会議の文字起こし、ライブ制作制御、音声アシスタントなど、多くのアプリに統合されており、プライバシー、速度、そして数行のSwiftコードによる使いやすさを重視しています。