このプロジェクトについて
LLMゲートウェイは、ローカルハードウェアを使用した個人のシングルユーザー利用向けに設計された、軽量で自己完結型のプロキシ/ルーターです。複数のLlama.cpp互換エンジンを動的に管理し、受信リクエストのパラメータ(特にコンテキストサイズの要件)に基づいて、適切なモデルバリアントを自動的に選択して起動します。システムは、スタンドアロンのトークナイザーまたは実行中のエンジンエンドポイントを介してトークン使用量を推定し、必要に応じて最適化された設定でエンジンを再起動し、メモリを節約するためにアイドル状態のインスタンスをシャットダウンします。
Luaスクリプト(例:example.cfg.lua)による設定をサポートしており、サーバー設定や、異なるコンテキストサイズ、バイナリパス、起動引数を持つモデルバリアントを定義できます。ユーザーは、動的な切り替えのために、1つのモデルに対して複数のバリアント(例:低VRAM用 vs 高パフォーマンス用)を設定できます。ゲートウェイは設定可能なIPv4/IPv6アドレスでリスンし、/v1/chat/completionsや/v1/modelsなどのOpenAI API互換エンドポイントを公開します。
内部ロックのため、一度に処理されるリクエストは1つだけです。現在はチャット完了エンドポイントのみを実装し、llama.cppエンジンのみをサポートしていますが、アーキテクチャ上の拡張は可能です。セットアップには、init.bat/shによるPython依存関係のインストール、設定ファイルの編集、およびrun.bat/shまたはuv run main.pyによる起動が含まれます。
警告:不適切な設定はメモリ不足やシステムフリーズを引き起こす可能性があります。設定は、組み込みのLuaスクリプトを使用してロード時に検証されます。これは研究/テストを目的とした実験的なソフトウェアであり、本番環境での使用は推奨されません。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.