Sobre o projeto

skill-up é uma ferramenta de linha de comando para avaliar Agent Skills, agentes e seus workspaces. Ela executa casos de avaliação declarativos em um Agent Engine, avalia a resposta e quaisquer mudanças no workspace e produz relatórios localmente ou em CI. Três modos de avaliação são descritos: avaliação de Skill, que mede o comportamento de uma Skill entre casos e pode comparar execuções com e sem a Skill; avaliação de Agent, que executa os mesmos casos sem instalar uma Skill para avaliar um engine ou agente personalizado por conta própria; e avaliação de Workspace, que verifica como um agente trabalha com arquivos e repositórios usando fixtures de caso ou um workspace local existente. A configuração é YAML declarativo: um eval.yaml mais arquivos cases/*.yaml definem o ambiente, engine, modelo e casos. A ferramenta provisiona um runtime local, Docker ou OpenSandbox por caso, pode instalar servidores MCP reais ou mockados configurados em engines suportados e pode enviar context.repo_fixture e context.files para o workspace. Execuções podem ser skill-optional, e um diretório local existente pode ser alvo com --workspace (exigindo environment.type: none, um caso por vez e benchmark mode desativado). Agent Engines integrados incluem Qoder CLI, Claude Code e Codex, com agentes definidos pelo usuário suportados por meio de engine.custom sobre transporte local. O julgamento suporta estratégias rule_based, script e agent_judge. Relatórios incluem grading.json e benchmark.json compatíveis com Anthropic, benchmark.md, além de result.json, saída JUnit XML e HTML. Um comando import migra evals.json no estilo Anthropic para o layout YAML, e --auto pode detectá-lo automaticamente. Uma Skill complementar chamada skill-upper é fornecida no repositório e destina-se a fechar um ciclo de avaliação para evolução: ela inspeciona falhas, repara ou expande a suíte de avaliação e reexecuta o skill-up por meio de conversa. Um pacote de plugin DeepSeek Harness adiciona captura durável de observação, casos de regressão com aprovação controlada, execuções isoladas e comparação de status. Uma GitHub Action na raiz do repositório executa avaliações em pull requests entre engines; é uma ação de contêiner Docker que exige um runner Linux e uma credencial de modelo armazenada como segredo, e fixa um digest de imagem imutável. Uma configuração em nível de usuário fornece variáveis de ambiente OpenTelemetry padrão e kwargs de runtime por ambiente, com uma cadeia de descoberta desde padrões incorporados, passando por arquivos de usuário e projeto, até um caminho --config explícito. Espera-se que segredos sejam referenciados via ${ENV_VAR} em vez de literais. A CLI expõe os subcomandos run, validate, list-cases, report, import e debug. O projeto é escrito em Go (>=1.25) e licenciado sob Apache 2.0.