这个项目能做什么
skill-up 是一个用于评估 Agent Skills、智能体及其工作区的命令行工具。它针对 Agent Engine 执行声明式评测用例,对回复及任何工作区变更进行评分,并在本地或 CI 中生成报告。
描述了三种评测模式:Skill 评测,衡量某个 Skill 在多个用例中的行为,并可比较安装与未安装该 Skill 时的运行结果;Agent 评测,在不安装 Skill 的情况下运行相同用例,以单独评估某个引擎或自定义智能体;Workspace 评测,使用用例夹具或现有本地工作区检查智能体如何处理文件和代码仓库。
配置采用声明式 YAML:eval.yaml 加上 cases/*.yaml 文件定义环境、引擎、模型和用例。该工具会为每个用例配置本地、Docker 或 OpenSandbox 运行时,可将配置好的真实或模拟 MCP 服务器安装到受支持的引擎中,并可将 context.repo_fixture 和 context.files 上传到工作区。运行可以是 skill-optional 的,也可通过 --workspace 指定现有本地目录(要求 environment.type: none、一次一个用例,并关闭 benchmark 模式)。
内置 Agent Engines 包括 Qoder CLI、Claude Code 和 Codex,并支持通过 engine.custom 在本地传输上使用用户自定义智能体。评判支持 rule_based、script 和 agent_judge 策略。报告包括与 Anthropic 兼容的 grading.json 和 benchmark.json、benchmark.md,以及 result.json、JUnit XML 和 HTML 输出。import 命令可将 Anthropic 风格的 evals.json 迁移为 YAML 布局,--auto 可自动检测该文件。
仓库中附带一个名为 skill-upper 的配套 Skill,旨在形成从评测到演进的闭环:它检查失败项,修复或扩展评测套件,并通过对话重新运行 skill-up。DeepSeek Harness 插件包增加了持久化观测捕获、经审批门控的回归用例、隔离运行和状态比较。仓库根目录的 GitHub Action 会在拉取请求上跨引擎运行评测;它是一个 Docker 容器 Action,需要 Linux runner 和以 secret 形式存储的模型凭据,并固定了不可变的镜像摘要。
用户级配置提供默认的 OpenTelemetry 环境变量和按环境划分的运行时 kwargs,发现链从内置默认值经用户和项目文件一直到显式的 --config 路径。Secrets 应通过 ${ENV_VAR} 引用,而不是使用字面量。CLI 提供 run、validate、list-cases、report、import 和 debug 子命令。该项目使用 Go(>=1.25)编写,采用 Apache 2.0 许可。
评论
0 评分人数达到10人后显示
登录后参与讨论。