このプロジェクトについて

Speech To Speechは、オープンソースモデルを使用して音声エージェントを構築するための完全にモジュラーなフレームワークです。音声対話パイプラインを4つの交換可能なステージに整理しています:音声活動検出(VAD)、音声テキスト変換(STT)、大規模言語モデル(LLM)、およびテキスト音声変換(TTS)。 主要機能: - **モジュラーアーキテクチャ**:すべてのコンポーネントが交換可能。Apple Silicon向けのMLX、NVIDIA GPU向けのCUDA、およびホストまたはセルフホストサーバー(例:vLLM、llama.cpp)向けのOpenAI互換APIを含む多様なバックエンドをサポートします。 - **Realtime API**:WebSocketおよびWebRTCを介してコアOpenAI Realtime GAイベントセットを公開し、低レイテンシのやり取りとライブ文字起こしを可能にします。 - **柔軟なデプロイメント**:MacまたはLinux上での完全ローカル実行、(ローカル音声+ホスト型LLMの)ハイブリッドモード、または外部クライアント用のサーバーとして実行可能です。 - **広範なモデルサポート**: - STT:Parakeet TDT、Whisper、Faster Whisper、Paraformer、Qwen3-ASR - LLM:Transformers、mlx-lm、および各種OpenAI互換プロバイダ - TTS:Qwen3-TTS、Kokoro-82M、Pocket TTS、ChatTTS、OmniVoice - **ツール統合**:同梱のPythonクライアントは、特定のモジュール契約を介したローカルツール呼び出しをサポートします。 - **LLMプロキシ**:オプションで、設定されたリモートLLMを並行サイドタスク用の標準OpenAI互換エンドポイントとして公開します。