Sobre o projeto
O LLM Systems Manager é uma plataforma de operações auto-hospedada para infraestrutura de LLM, cobrindo monitoramento, controle remoto, ajuste, roteamento e alertas em um só lugar. Ele integra telemetria de sessão de llama.cpp, vLLM, LM Studio, stable-diffusion.cpp e OpenClaw, enquanto seu agente reporta métricas gerais de host para qualquer máquina Linux ou macOS; a integração com Ollama está listada no roadmap.
Os caminhos de instalação incluem um instalador de script interativo (a rota preferida, lidando com pré-requisitos, InfluxDB, configuração, TLS e agentes), pacotes nativos .deb/.rpm, Docker Compose para um plano de controle containerizado, fórmulas Homebrew para macOS Apple Silicon e Linux, e um tarball binário de agente autônomo para hosts sem Python. O instalador implanta a versão mais recente do GitHub Release com verificação SHA-256 e habilita unidades systemd sem iniciar serviços automaticamente.
Capacidades principais descritas no README:
- Piloto Automático de Modelos: posicionamento de modelos por estado declarado, controlado pela memória do host (VRAM ou RAM), failover quando um host cai, e escalonamento de réplicas conforme a demanda. Desativado por padrão; ele propõe e o operador aprova.
- Gateway de inferência compatível com OpenAI: um endpoint único na frente de llama.cpp, LM Studio e vLLM, com catálogo /v1/models mesclado e roteamento por pin por modelo, round-robin de pool ou failover.
- Cartão de Relatório de GPU: um benchmark padronizado que produz cartões comparáveis com tempo até o primeiro token, throughput de prefill e geração, tokens/joule, $/Mtok medido e a GPU usada.
- Inteligência de energia e custo: $/Mtok medido a partir do consumo real de energia, economia mensal em relação aos preços de API hospedada, contabilização de energia ociosa e um gerenciador de desempenho por host que ajusta o governador de CPU e perfis de resfriamento conforme a carga.
- Benchmarking e ajuste automático: benchmarks em toda a biblioteca, além de ajustadores automáticos para configuração de contexto/slots do llama.cpp e max-model-len do vLLM.
- Gerenciamento de modelos: downloads e poda do Hugging Face, além de perfis nomeados (chat/código/geral) para recarga com um clique.
- Controle remoto sem SSH: executar servidores, trocar modelos a quente, editar configurações, atualizar llama.cpp, acompanhar logs e abrir um terminal no navegador; um bot do Discord expõe comandos semelhantes.
- Telemetria e alertas cientes de LLM: slots, tokens/seg, processamento de prompt, cache KV e contexto, juntamente com estatísticas de GPU, PSU, UPS e resfriamento; um mecanismo de alarme autônomo persiste amostras no InfluxDB, avalia regras de limite e anomalia, notifica via e-mail/toast/webhook/Discord, armazena em buffer durante interrupções e correlaciona alertas relacionados em incidentes.
Recursos adicionais incluem um lançador de Ferramentas (Cartão de Relatório, Benchmark, Autotune com um registro de execução em toda a frota), opções de layout e aparência (mecanismos Grid ou Flow, predefinições de função, densidade compacta, sete temas), um companheiro de telefone PWA instalável com alertas push, funções multiusuário com log de auditoria de administrador, backups agendados criptografados, análise de custo/orçamento do OpenClaw, uma aba de geração de imagens e TLS/mTLS em todas as conexões com suporte para trazer seu próprio certificado.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.