このプロジェクトについて
Smart SLM Routerは、LLMリクエストをインテリジェントにルーティングすることでAPIコストを削減するために設計された非同期ローカルプロキシです。OpenAI API仕様に完全準拠しており、ベースURLを更新するだけで、既存のOpenAI SDKアプリケーションのドロップインリプレースメントとして利用可能です。
主な機能は以下の通りです:
- ローカル意図分類:長さのヒューリスティック、トークン正規表現パターン、ツール呼び出しインジケーターを使用して、ネットワーク遅延を発生させることなく15ms未満でルーティングを決定します。
- ダイナミックルーティング:単純なクエリはSLM(OllamaやvLLM経由など)に誘導し、複雑なクエリ、技術的なクエリ、またはマルチステップのクエリはTier-1の最先端モデル(GPT-4o、Claudeなど)にエスカレーションします。
- 透明なフォールバック:SLMが接続失敗、モデルによる拒否、またはJSONパースエラーを返した場合、自動的にリトライし、最先端モデルにリクエストをエスカレーションします。
- フルAPIサポート:非ストリーミングおよびストリーミング(SSE)レスポンスの両方をサポートしています。
- オブザーバビリティ:`/metrics`エンドポイントを提供し、リアルタイムのUSDコスト削減額、リクエスト数、決定レイテンシを追跡できます。
本システムはPython 3.12+とFastAPIで構築されており、バックエンドURL、モデル名、トークンしきい値の設定には環境変数を利用します。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.