このプロジェクトについて
FluidVoiceは、macOS向けのオープンソースの音声テキスト変換ディクテーションアプリケーションで、クラウドディクテーションサービスのローカル代替として位置づけられています。GPLv3で配布され、Homebrew caskまたは手動リリースダウンロードでインストール可能です。
中核機能は、グローバルホットキーで起動する音声テキスト変換ディクテーションで、アクセシビリティAPIを通じて任意のアプリにテキストが直接挿入されます。ライブプレビューオーバーレイが話している内容をリアルタイムで表示し、MacBook向けのノッチ対応レイアウトも含まれます。
音声認識はオンデバイスで実行されます。サポートされるモデルには、Nemotron Speech 3.5バリアント、Parakeet Flash、Parakeet TDT v3およびv2、Cohere Transcribe、Apple Speech、WhisperのTinyからLargeまでのサイズが含まれます。言語カバレッジはモデルによって異なります:Parakeet TDT v3は25言語、Cohere Transcribeは14言語、Nemotronは約40言語、Whisperは最大99言語をカバーします。ほとんどのモデルにはApple Siliconが必要で、Intel MacはWhisperを通じてサポートされます。
単純なディクテーションに加えて、アプリは音声でMacを操作するためのコマンドモード(アプリ起動、ショートカット実行、システムアクション起動)と、任意のテキストフィールドでテキストを書いたり書き直したりするためのライトモードを提供します。オプションのAI拡張機能は、OpenAI、Groq、カスタムプロバイダー、またはFluid Intelligenceと呼ばれるバンドルされたローカルモデルを使用してトランスクリプトを後処理でき、データをマシンから送信せずにフォーマット、大文字化、クリーンアップを処理します。アプリごとのプロンプトセットも設定可能です。
その他の機能には、オプションのローカル音声履歴(予算制御とZIPエクスポート付き)、毎日の使用統計、アダプティブライト/ダークテーマ、メニューバー統合、オプションのベータチャンネル付き自動更新、設定可能なオーバーレイサイズが含まれます。プロジェクトはローカルファーストであると述べています:クラウドAIプロバイダーが明示的に有効にされない限り、音声、オーディオ、および書き起こされたテキストはデバイスに留まります。匿名の週次アクティビティ分析がデフォルトで送信されますが、無効にできます。
要件は、macOS 15.0以降、マイクアクセス、アクセシビリティ権限、および音声モデル用に約1 GBのディスクスペース(オプションのFluid Intelligenceモデルにはさらに約3.5 GB)です。ソースからのビルドにはXcodeとSwift Package Managerを使用します。ビルドスクリプトは署名付きおよび署名なしのビルドをサポートし、統合テストはxcodebuildで実行されます。READMEには、iOSおよびWindowsバージョンが計画されているがまだ利用できないと記載されています。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.