프로젝트 소개
LLM Systems Manager는 모니터링, 원격 제어, 튜닝, 라우팅, 알림을 한곳에서 다루는 LLM 인프라용 자체 호스팅 운영 플랫폼입니다. llama.cpp, vLLM, LM Studio, stable-diffusion.cpp 및 OpenClaw 세션 텔레메트리를 통합하며, 에이전트는 모든 Linux 또는 macOS 머신의 일반 호스트 지표를 보고합니다. Ollama 통합은 로드맵으로 기재되어 있습니다.
설치 경로에는 대화형 스크립트 설치 프로그램(권장 경로로, 사전 요구 사항, InfluxDB, 구성, TLS 및 에이전트를 처리), 네이티브 .deb/.rpm 패키지, 컨테이너화된 컨트롤 플레인을 위한 Docker Compose, macOS Apple Silicon 및 Linux용 Homebrew 포뮬러, Python이 없는 호스트를 위한 독립 실행형 에이전트 바이너리 tarball이 포함됩니다. 설치 프로그램은 SHA-256 검증과 함께 최신 GitHub Release를 배포하고 서비스를 자동으로 시작하지 않고 systemd 유닛을 활성화합니다.
README에 설명된 주요 기능:
- Model Autopilot: 호스트 메모리(VRAM 또는 RAM)를 기준으로 한 선언적 상태 모델 배치, 호스트 이탈 시 페일오버, 수요에 따른 레플리카 스케일링. 기본적으로 꺼져 있으며 제안하고 운영자가 승인합니다.
- OpenAI 호환 추론 게이트웨이: llama.cpp, LM Studio 및 vLLM을 앞에 두는 단일 엔드포인트로, 병합된 /v1/models 카탈로그와 모델별 핀, 풀 라운드 로빈 또는 페일오버에 의한 라우팅을 제공합니다.
- GPU Report Card: 첫 토큰까지의 시간, 프리필 및 생성 처리량, tokens/joule, 측정된 $/Mtok 및 사용된 GPU를 포함한 비교 가능한 카드를 생성하는 표준화된 벤치마크.
- 에너지 및 비용 인텔리전스: 실제 전력 소비로부터 측정된 $/Mtok, 호스팅 API 가격 대비 월간 절감액, 유휴 전력 회계, 부하에 따라 CPU governor와 냉각 프로필을 조정하는 호스트별 성능 관리자.
- 벤치마킹 및 오토튜닝: 라이브러리 전체 벤치마크와 llama.cpp 컨텍스트/슬롯 구성 및 vLLM max-model-len을 위한 오토튜너.
- 모델 관리: Hugging Face 다운로드 및 정리, 원클릭 재로드를 위한 명명된 프로필(chat/code/general).
- SSH 없는 원격 제어: 서버 실행, 모델 핫스왑, 구성 편집, llama.cpp 업데이트, 로그 tail, 브라우저 내 터미널 열기; Discord 봇이 유사한 명령을 노출합니다.
- LLM 인식 텔레메트리 및 알림: 슬롯, tokens/sec, 프롬프트 처리, KV 캐시 및 컨텍스트와 GPU, PSU, UPS 및 냉각 통계; 독립 실행형 알람 엔진이 샘플을 InfluxDB에 유지하고 임계값 및 이상 규칙을 평가하며 이메일/toast/webhook/Discord로 알리고 중단을 버퍼링하며 관련 알림을 인시던트로 상관시킵니다.
추가 기능으로는 Tools 런처(Report Card, Benchmark, 플릿 전체 실행 원장이 있는 Autotune), 레이아웃 및 모양 옵션(Grid 또는 Flow 엔진, 역할 프리셋, 컴팩트 밀도, 7가지 테마), 푸시 알림이 있는 설치 가능한 PWA 폰 컴패니언, 관리자 감사 로그가 있는 다중 사용자 역할, 암호화된 예약 백업, OpenClaw 비용/예산 분석, 이미지 생성 탭, 자체 인증서 사용 지원과 함께 모든 연결에 TLS/mTLS가 포함됩니다.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.