프로젝트 소개
LLM 게이트웨이는 로컬 하드웨어를 사용하는 개인 단일 사용자를 위해 설계된 경량의 독립형 프록시/라우터입니다. 이 시스템은 여러 개의 Llama.cpp 호환 엔진을 동적으로 관리하며, 특히 컨텍스트 크기 요구 사항과 같은 들어오는 요청 파라미터에 따라 적절한 모델 변형을 자동으로 선택하고 실행합니다. 시스템은 독립형 토크나이저 또는 실행 중인 엔진 엔드포인트를 통해 토큰 사용량을 추정하고, 필요 시 최적화된 구성으로 엔진을 재시작하며, 메모리 절약을 위해 유휴 인스턴스를 종료합니다.
Lua 스크립트(예: example.cfg.lua)를 통한 설정을 지원하며, 이를 통해 서버 설정과 서로 다른 컨텍스트 크기, 바이너리 경로, 시작 인수를 가진 모델 변형을 정의할 수 있습니다. 사용자는 동적 전환을 위해 모델당 여러 변형(예: 낮은 VRAM용 vs 고성능용)을 구성할 수 있습니다. 게이트웨이는 설정 가능한 IPv4/IPv6 주소에서 대기하며 /v1/chat/completions 및 /v1/models와 같은 OpenAI API 호환 엔드포인트를 제공합니다.
내부 잠금(locking)으로 인해 한 번에 하나의 요청만 처리됩니다. 현재는 채팅 완성(chat completions) 엔드포인트만 구현되어 있으며 llama.cpp 엔진만 지원하지만, 아키텍처상 확장이 가능합니다. 설치는 init.bat/sh를 통한 Python 의존성 설치, 설정 파일 수정, 그리고 run.bat/sh 또는 uv run main.py를 통한 실행 과정으로 이루어집니다.
경고: 잘못된 설정은 메모리 고갈이나 시스템 프리징을 유발할 수 있습니다. 설정은 로드 시 내장된 Lua 스크립트를 통해 검증됩니다. 본 소프트웨어는 연구 및 테스트를 위한 실험적 소프트웨어이며, 운영 환경에서의 사용은 권장되지 않습니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.