À propos du projet
LLM Systems Manager est une plateforme d'exploitation auto-hébergée pour l'infrastructure LLM, couvrant la surveillance, le contrôle à distance, le réglage, le routage et les alertes en un seul endroit. Elle intègre la télémétrie de session de llama.cpp, vLLM, LM Studio, stable-diffusion.cpp et OpenClaw, tandis que son agent rapporte des métriques générales de l'hôte pour toute machine Linux ou macOS ; l'intégration d'Ollama est listée comme feuille de route.
Les chemins d'installation incluent un installateur de script interactif (la voie privilégiée, gérant les prérequis, InfluxDB, la configuration, TLS et les agents), des paquets natifs .deb/.rpm, Docker Compose pour un plan de contrôle conteneurisé, des formules Homebrew pour macOS Apple Silicon et Linux, et une archive binaire d'agent autonome pour les hôtes sans Python. L'installateur déploie la dernière version GitHub Release avec vérification SHA-256 et active les unités systemd sans démarrer les services automatiquement.
Les capacités principales décrites dans le README :
- Pilote automatique de modèles : placement de modèles à état déclaré conditionné par la mémoire de l'hôte (VRAM ou RAM), basculement lorsqu'un hôte tombe en panne, et mise à l'échelle des répliques selon la demande. Désactivé par défaut ; il propose et l'opérateur approuve.
- Passerelle d'inférence compatible OpenAI : un point de terminaison devant llama.cpp, LM Studio et vLLM, avec un catalogue /v1/models fusionné et un routage par épinglage par modèle, round-robin de pool, ou basculement.
- Carte de rapport GPU : un benchmark standardisé produisant des cartes comparables avec le temps jusqu'au premier jeton, le débit de préremplissage et de génération, les jetons/joule, le $/Mtok mesuré et le GPU utilisé.
- Intelligence énergétique et de coûts : $/Mtok mesuré à partir de la consommation électrique réelle, économies mensuelles par rapport aux tarifs d'API hébergés, comptabilité de la puissance au repos, et un gestionnaire de performance par hôte qui ajuste le gouverneur du CPU et les profils de refroidissement en fonction de la charge.
- Benchmarking et optimisation automatique : benchmarks à l'échelle de la bibliothèque plus des optimiseurs automatiques pour la configuration du contexte/des slots de llama.cpp et max-model-len de vLLM.
- Gestion des modèles : téléchargements et élagage Hugging Face, plus des profils nommés (chat/code/général) pour un rechargement en un clic.
- Contrôle à distance sans SSH : exécuter des serveurs, échanger des modèles à chaud, modifier des configurations, mettre à jour llama.cpp, suivre les journaux, et ouvrir un terminal dans le navigateur ; un bot Discord expose des commandes similaires.
- Télémétrie et alertes conscientes des LLM : slots, jetons/seconde, traitement des invites, cache KV et contexte aux côtés des statistiques GPU, PSU, UPS et refroidissement ; un moteur d'alarme autonome persiste les échantillons dans InfluxDB, évalue les règles de seuil et d'anomalie, notifie par e-mail/toast/webhook/Discord, met en mémoire tampon pendant les pannes, et corrèle les alertes liées en incidents.
Des fonctionnalités supplémentaires incluent un lanceur d'outils (Carte de rapport, Benchmark, Optimisation automatique avec un registre d'exécution à l'échelle de la flotte), des options de disposition et d'apparence (moteurs Grille ou Flux, préréglages de rôle, densité compacte, sept thèmes), un compagnon PWA installable pour téléphone avec alertes push, des rôles multi-utilisateurs avec un journal d'audit administrateur, des sauvegardes planifiées chiffrées, des analyses de coûts/budget OpenClaw, un onglet de génération d'images, et TLS/mTLS sur toutes les connexions avec prise en charge de votre propre certificat.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.