このプロジェクトについて

SGLang-Omniは、オムニ、音声、テキスト読み上げモデルを対象としたSGLangプロジェクトのサービングフレームワークです。生成を単一のモノリシックなステップとして扱うのではなく、推論を協調するステージのパイプラインとしてモデル化します。すなわち、前処理、エンコーダ、自己回帰エンジン、トーカー、デコーダ、ボコーダ、アグリゲータです。各ステージはそのワークロードに適したスケジューラの背後で動作し、コントロールプレーンがリクエストを調整し、リレーデータプレーンが共有メモリ、NCCL、NIXL、Mooncakeバックエンドを介してテンソルペイロードを移動させます。該当する場合には、自己回帰スケジューリングとモデル実行のためにSGLangと組み合わせて構成されます。 このプロジェクトは、マルチモーダルチャット、音声生成、バッチおよびストリーミング音声、アップロードされた音声、音声文字起こしをカバーするOpenAI互換のAPIサーフェスを公開しています。別個のSGLang-Omni Routerは、ヘルス、レディネス、ライフサイクル、ケイパビリティディスカバリを備えたマルチワーカーのフロントドアとして機能します。 READMEに記載されているモデルカバレッジには、Qwen3-OmniやMing-Omniなどのオムニチャットおよび音声モデル、MiniMax Music 3による音楽生成(歌詞とキャプションから32 kHzステレオへ)、Higgs Audio v3、MOSS-TTS、MOSS-TTS Local、Fish Speech S2-Pro、Qwen3-TTS、Voxtral TTS、Ming-Omni-TTS、dots.tts、ZONOS2による音声生成、そしてQwen3-ASR、Fun-ASR、ARK-ASR、MOSS-Transcribe-Diarizeによる文字起こし/話者分離が含まれます。後者はverbose_jsonを介して話者ラベルとタイムスタンプをサポートします。最近のニュース項目では、テキスト/音声指示と音声編集のためのAuKおよびAuK-Flashのサポートにも言及しています。 ハードウェアサポートは、NVIDIA CUDA(デフォルト、完全なモデルカバレッジ)、Apple Silicon(実験的、macOS arm64上のMLXまたはTorch MPSによるQwen3-ASR)、Intel XPU(実験的、Qwen3-ASR、Qwen3-TTS、Qwen3-Omniをエンドツーエンドでサービングし、バックエンドを自動検出)として文書化されています。インストールはPyPIから可能で、macOS Apple Silicon向けのワンコマンドインストールスクリプトがあり、広範なドキュメント、クックブック、開発者リファレンスへのリンクが提供されています。このプロジェクトはオープンソースライセンスの下でライセンスされており、推論システム、カーネル、スケジューリング、ステージ間通信、モデルランナー、ベンチマーク、デプロイメントに関するコントリビューションを歓迎しています。