这个项目能做什么

jevos 是 Jev 的本地开源替代方案,用于是/否决策。你发送一段文本(“状态”)以及一个或多个是/否问题,它会为每个问题返回 P(yes)。它被设计为在笔记本 CPU 上运行,根据请求长度,报告的延迟大约为 50-220 毫秒。 功能 - 是/否问题:每个答案都是 0 到 1 之间的概率(“noul”值)。 - 可以在单个请求中询问多个命名问题;它们共享同一状态,该状态只读取一次,因此多个问题的成本低于分别询问。 - 状态可以是普通字符串,也可以是任意 JSON 对象/数组。 - 暂不支持多选和评分问题类型(它们被列为“即将推出”);此类请求会被拒绝并返回 HTTP 422。 运行方式 - 它使用通过 llama.cpp 提供的量化 GGUF 模型(jevos-q4_k_m.gguf),并可通过 --device cpu 和选定的线程数固定到 CPU。 - 服务器使用 TypeSafe Jev 的线上格式,因此为 Jev SDK 编写的代码在是/否问题上无需修改即可工作。 API 和 CLI - POST /v1/systemone 接受 model、state 和 questions,并返回答案以及 token 用量。 - 还提供 GET /v1/models 和 GET /health;响应包含带有推理时间的 Server-Timing 头。 - CLI 命令 jev decide 无需启动服务器即可回答单个请求文件,并可选地将答案写入新文件(不会覆盖现有文件)。 - 快速开始使用 uv 安装依赖、下载 llama.cpp 运行时,并在 127.0.0.1:8017 上启动服务器。 实用说明 - README 建议将决策规则直接放入问题的 instructions 中;Jev 的可选 criteria 字段会被接受但被忽略。 - wiki 涵盖零样本文本分类、CPU 上的 LLM-as-a-judge、策略决策,以及观察到的模型行为,例如为什么小型 LLM 在答案是否定时会说是。 - 该项目被标注为与 Loris Salsi(@LosaLosSantos)共同构建。