这个项目能做什么
Jano是一个轻量级的OpenAI兼容HTTP路由器,专为在单个GPU上运行多个本地大语言模型(LLM)的用户设计。它通过实现贪心批处理来降低开销:并非每次请求切换模型,而是优先处理当前已加载模型的所有待处理请求,仅在必要时才进行切换。这种机制可将每次请求波次的模型切换次数从多次减少至一次,在本地硬件上可节省30秒至3分钟的时间。
Jano支持多种后端类型,包括本地后端(如llama-server、vLLM)和远程API(如DeepSeek),并具备自动模型名称重写功能以适应远程提供商。内置遥测系统通过/health、/status和Prometheus指标端点,提供队列深度、切换持续时间、令牌吞吐量及后端健康状态的监控。
配置通过环境变量和models.json文件完成,用户可定义模型名称、URL、别名及可选的切换脚本。切换脚本遵循简洁的接口约定:接收模型名称参数,激活对应后端后正常退出;可选的状态报告功能有助于检测初始状态。
Jano采用每后端串行化请求的方式简化逻辑,适合个人或小规模部署场景,不适用于多租户服务。需要说明的是,Jano不负责GPU温度或系统资源管理,这些功能不在其设计范围内。作为现有工具的薄封装层,Jano提供对模型切换的精确控制,兼容任何OpenAI风格的后端,并透明支持流式传输和工具调用功能。
如果您仅使用Ollama或单一模型,则无需此工具。Jano最适合已拥有自定义后端并希望精细控制路由和切换流程的用户。
评论
0 评分人数达到10人后显示
登录后参与讨论。