このプロジェクトについて

# llm-d Routerの概要 llm-d Routerは、Kubernetes環境における推論トラフィックのインテリジェントなエントリポイントです。負荷認識およびプレフィックスキャッシュ認識ルーティング、リクエストの優先順位付け、高度なフロー制御を提供することで、LLMサービングを最適化するように設計されています。多様なリクエスト形式と複雑なサービング目標をサポートしており、本番グレードのAIデプロイメントに適しています。 ## 主要コンポーネント このリポジトリには、以下の主要コンポーネントが含まれています。 1. **Endpoint Picker (EPP)**: ルーターの「頭脳」として機能するインテリジェントなルーティングエンジンです。InferencePoolの現在の状態に対して受信リクエストを評価し、KVキャッシュの局所性、現在の負荷、優先度などの要素を考慮して最適な配置決定を行います。ext-procプロトコルを介してL7プロキシと統合します。 2. **リクエスト管理API**: EPPの動作に影響を与えるリソースです。 - **InferenceObjective**: 優先度レベルやパフォーマンスターゲットを含む、特定のリクエストのスケジューリング目標を設定します。 - **InferenceModelRewrite**: A/Bテストやカナリアリリースをサポートする、柔軟なトラフィック管理のためのモデル名書き換えを有効にします。 3. **分離サイドカー**: モデルサーバー(通常はデコードワーカーのサイドカーとして)と一緒にデプロイされる調整コンポーネントです。KVキャッシュと埋め込み転送を管理するために専門のワーカーと通信し、P/D(プリフィル/デコード)やE/P/D(エンコード/プリフィル/デコード)などの複雑な多段階推論ライフサイクルを調整します。 ## 動作モード llm-d Routerは、2つの主要なデプロイメントモードをサポートしています。 ### 1. スタンドアロンモード このモードは、Gateway APIインフラストラクチャを必要とせずに自己管理型のEnvoyプロキシを使用します。スタンドアロンのHelmチャートは、2つのトポロジーをサポートしています。 - **サイドカーモード**(デフォルト): プロキシはEPPポッド内で実行され、基本的なテストやローカル評価に適しています。 - **サービスモード**: プロキシは別の水平スケーラブルなDeploymentおよびServiceとして実行され、そのServiceを介してEPPに到達します。`router.proxy.mode=service`を設定して、プロキシを独立してスケーリングします。 ### 2. ゲートウェイモード(推論ゲートウェイ) 推奨される本番モードであり、公式のKubernetes Gateway APIを活用します。EPPはInferencePoolのバックエンドとして機能し、共有ゲートウェイ上のHTTPRouteによって参照されます。これにより、高度なトラフィック管理、マルチクラスタの負荷分散、および推論と従来のワークロードの両方のための共有インフラストラクチャが可能になります。 ## アーキテクチャとドキュメント このプロジェクトは、包括的なドキュメントを提供しています。 - アーキテクチャの詳細、ルーティングロジック、プラグイン(フィルターとスコアラー) - 高負荷または長いコンテキストのワークロードのためのコンテナサイズ設定の推奨事項 - OpenTelemetry JSON stdoutログ形式の仕様 - 分離セットアップガイド - セキュリティのためのアーティファクト検証手順 ## 技術的要件 自動Envoyインストールのために、プロジェクトはツールを提供していますが、手動インストールにはext-procフィルターでの`FULL_DUPLEX_STREAMED`リクエスト/レスポンスボディモードのサポートが必要です。 ## コミュニティと貢献 このプロジェクトは、隔週ミーティング、専用のSlackチャンネル(#sig-router)、および貢献ガイドラインを通じてコミュニティの参加を奨励しています。llm-d組織の貢献ガイドに従い、大きな変更はまずイシューで議論する必要があります。 ## セキュリティ 公開されているコンテナイメージには、署名付きの来歴証明とSBOM(ソフトウェア部品表)が添付されています。セキュリティ報告ガイドラインはSECURITY.mdに文書化されており、リリースされたアーティファクトの検証手順も含まれています。 全体として、llm-d Routerは、特に分離サービング要件を持つ最新のLLMワークロードにおいて、Kubernetesでインテリジェントでスケーラブルな推論ルーティングを求める組織にとって堅牢なソリューションです。