このプロジェクトについて

LLM Systems Managerは、LLMインフラ向けのセルフホスト運用プラットフォームであり、監視、リモート操作、チューニング、ルーティング、アラートを1か所に統合します。llama.cpp、vLLM、LM Studio、stable-diffusion.cpp、OpenClawセッションテレメトリを統合し、エージェントはLinuxまたはmacOSマシンの一般的なホストメトリクスを報告します。Ollama統合はロードマップに記載されています。 インストール方法には、対話型スクリプトインストーラー(推奨ルートで、前提条件、InfluxDB、設定、TLS、エージェントを処理)、ネイティブ.deb/.rpmパッケージ、コンテナ化されたコントロールプレーン用のDocker Compose、macOS Apple SiliconおよびLinux用のHomebrew formula、Pythonなしのホスト向けのスタンドアロンエージェントバイナリtarballがあります。インストーラーは、SHA-256検証付きの最新GitHubリリースを展開し、systemdユニットを有効化しますが、サービスは自動起動しません。 READMEに記載されている主な機能は次のとおりです。 - モデル自動運用: ホストメモリ(VRAMまたはRAM)に基づく宣言状態のモデル配置、ホストが停止した場合のフェイルオーバー、需要に応じたレプリカスケーリング。デフォルトではオフで、提案をオペレーターが承認します。 - OpenAI互換推論ゲートウェイ: llama.cpp、LM Studio、vLLMを前面に置く1つのエンドポイントで、統合された/v1/modelsカタログと、モデルごとのピン、プールラウンドロビン、またはフェイルオーバーによるルーティングを提供。 - GPUレポートカード: 標準化されたベンチマークで、初回トークンまでの時間、プリフィルおよび生成スループット、トークン/ジュール、測定された$/Mtok、使用GPUを比較可能なカードとして生成。 - エネルギーおよびコストインテリジェンス: 実際の電力消費からの測定$/Mtok、ホスト型API価格に対する月間節約額、アイドル電力の計上、および負荷に応じてCPUガバナーと冷却プロファイルを調整するホストごとのパフォーマンスマネージャー。 - ベンチマークと自動チューニング: ライブラリ全体のベンチマークに加え、llama.cppのコンテキスト/スロット設定とvLLMのmax-model-len用の自動チューナー。 - モデル管理: Hugging Faceからのダウンロードとプルーニング、およびワンクリック再読み込み用の名前付きプロファイル(チャット/コード/一般)。 - SSHなしのリモート操作: サーバー実行、モデルのホットスワップ、設定編集、llama.cpp更新、ログのテール、ブラウザ内ターミナルを開く。Discordボットも同様のコマンドを公開。 - LLM対応テレメトリとアラート: スロット、トークン/秒、プロンプト処理、KVキャッシュ、コンテキストに加え、GPU、PSU、UPS、冷却統計。スタンドアロンのアラームエンジンはサンプルをInfluxDBに永続化し、しきい値と異常ルールを評価し、メール/トースト/ウェブフック/Discordで通知し、障害中はバッファリングし、関連アラートをインシデントに相関付けます。 追加機能には、ツールランチャー(レポートカード、ベンチマーク、フリート全体の実行台帳付き自動チューニング)、レイアウトと外観オプション(GridまたはFlowエンジン、ロールプリセット、コンパクト密度、7つのテーマ)、プッシュアラート付きインストール可能なPWA電話コンパニオン、監査ログ付きマルチユーザーロール、暗号化されたスケジュールバックアップ、OpenClawコスト/予算分析、画像生成タブ、および独自証明書の持ち込みをサポートする全接続でのTLS/mTLSが含まれます。