这个项目能做什么

LLM gateway 是一个轻量级、自包含的代理/路由器,专为使用本地硬件的个人单用户设计。它能够动态管理多个兼容 Llama.cpp 的引擎,并根据传入的请求参数(特别是上下文大小要求)自动选择并启动相应的模型变体。该系统通过独立的分词器或运行中的引擎端点估算 token 使用量,在需要时以优化配置重启引擎,并关闭空闲实例以节省内存。 它支持通过 Lua 脚本(例如 example.cfg.lua)进行配置,定义服务器设置以及具有不同上下文大小、二进制路径和启动参数的模型变体。用户可以为每个模型配置多个变体(例如低 VRAM 版与高性能版)以实现动态切换。该网关监听可配置的 IPv4/IPv6 地址,并提供与 OpenAI API 兼容的端点,如 /v1/chat/completions 和 /v1/models。 由于内部锁机制,系统一次仅处理一个请求。目前它仅实现了聊天补全(chat completions)端点并仅支持 llama.cpp 引擎,但其架构允许扩展。安装步骤包括通过 init.bat/sh 安装 Python 依赖项,编辑配置文件,然后使用 run.bat/sh 或 uv run main.py 启动。 警告:配置不当可能会导致内存耗尽或系统冻结。配置在加载时会使用嵌入的 Lua 脚本进行验证。本软件为实验性软件,旨在用于研究/测试,不建议用于生产环境。