프로젝트 소개

skill-up은 Agent Skills, 에이전트 및 해당 워크스페이스를 평가하기 위한 명령줄 도구입니다. Agent Engine에 대해 선언적 평가 케이스를 실행하고 응답과 워크스페이스 변경 사항을 채점한 후 로컬 또는 CI에서 보고서를 생성합니다. 세 가지 평가 모드가 설명되어 있습니다. Skill 평가는 케이스 전반에 걸쳐 Skill의 동작을 측정하며 Skill을 사용한 실행과 사용하지 않은 실행을 비교할 수 있습니다. Agent 평가는 Skill을 설치하지 않고 동일한 케이스를 실행하여 엔진 또는 사용자 정의 에이전트 자체를 평가합니다. Workspace 평가는 케이스 픽스처 또는 기존 로컬 워크스페이스를 사용하여 에이전트가 파일 및 리포지토리와 작업하는 방식을 확인합니다. 구성은 선언적 YAML입니다. eval.yaml과 cases/*.yaml 파일이 환경, 엔진, 모델 및 케이스를 정의합니다. 이 도구는 케이스별로 로컬, Docker 또는 OpenSandbox 런타임을 프로비저닝하고, 지원되는 엔진에 구성된 실제 또는 모의 MCP 서버를 설치할 수 있으며, context.repo_fixture와 context.files를 워크스페이스에 업로드할 수 있습니다. 실행은 skill-optional일 수 있으며, --workspace를 사용하여 기존 로컬 디렉터리를 대상으로 지정할 수 있습니다(environment.type: none, 한 번에 하나의 케이스, benchmark 모드 해제 필요). 내장 Agent Engine에는 Qoder CLI, Claude Code, Codex가 포함되며, engine.custom을 통해 로컬 전송으로 사용자 정의 에이전트가 지원됩니다. 채점은 rule_based, script, agent_judge 전략을 지원합니다. 보고서에는 Anthropic 호환 grading.json 및 benchmark.json, benchmark.md, result.json, JUnit XML 및 HTML 출력이 포함됩니다. import 명령은 Anthropic 스타일 evals.json을 YAML 레이아웃으로 마이그레이션하며, --auto로 자동 감지할 수 있습니다. 저장소에는 skill-upper라는 동반 Skill이 포함되어 있으며, 평가에서 진화로 이어지는 루프를 완성하기 위한 것입니다. 이 Skill은 실패를 검사하고 평가 스위트를 수리하거나 확장한 후 대화를 통해 skill-up을 다시 실행합니다. DeepSeek Harness 플러그인 번들은 지속적인 관찰 캡처, 승인 게이트 회귀 케이스, 격리된 실행 및 상태 비교를 추가합니다. 저장소 루트의 GitHub Action은 풀 리퀘스트에서 여러 엔진에 걸쳐 평가를 실행합니다. 이는 Linux 러너와 시크릿으로 저장된 모델 자격 증명이 필요한 Docker 컨테이너 액션이며, 불변 이미지 다이제스트를 고정합니다. 사용자 수준 구성은 기본 OpenTelemetry 환경 변수와 환경별 런타임 kwargs를 제공하며, 내장 기본값에서 사용자 및 프로젝트 파일을 거쳐 명시적 --config 경로까지 검색 체인이 적용됩니다. 시크릿은 리터럴이 아닌 ${ENV_VAR}로 참조되어야 합니다. CLI는 run, validate, list-cases, report, import, debug 하위 명령을 제공합니다. 이 프로젝트는 Go(>=1.25)로 작성되었으며 Apache 2.0 라이선스를 따릅니다.