Об этом проекте

skill-up — это инструмент командной строки для оценки Agent Skills, агентов и их рабочих пространств. Он выполняет декларативные кейсы оценки на Agent Engine, оценивает ответ и любые изменения рабочего пространства и формирует отчёты локально или в CI. Описаны три режима оценки: оценка Skill, которая измеряет поведение Skill на множестве кейсов и может сравнивать запуски с Skill и без него; оценка Agent, которая выполняет те же кейсы без установки Skill, чтобы оценить движок или пользовательского агента сам по себе; и оценка Workspace, которая проверяет, как агент работает с файлами и репозиториями, используя фикстуры кейсов или существующее локальное рабочее пространство. Конфигурация декларативная, в YAML: файл eval.yaml вместе с файлами cases/*.yaml определяет окружение, движок, модель и кейсы. Инструмент подготавливает локальную среду выполнения, Docker или OpenSandbox для каждого кейса, может устанавливать настроенные реальные или моковые MCP-серверы в поддерживаемые движки и может загружать context.repo_fixture и context.files в рабочее пространство. Запуски могут быть skill-optional, а существующий локальный каталог можно указать через --workspace (требуется environment.type: none, по одному кейсу за раз и выключенный режим benchmark). Встроенные Agent Engines включают Qoder CLI, Claude Code и Codex, а пользовательские агенты поддерживаются через engine.custom по локальному транспорту. Оценивание поддерживает стратегии rule_based, script и agent_judge. Отчёты включают совместимые с Anthropic grading.json и benchmark.json, benchmark.md, а также result.json, JUnit XML и вывод в HTML. Команда import переносит Anthropic-подобные evals.json в YAML-структуру, а --auto может обнаружить их автоматически. В репозитории поставляется сопутствующий Skill под названием skill-upper, предназначенный для замыкания цикла от оценки к эволюции: он изучает сбои, исправляет или расширяет набор оценок и перезапускает skill-up через диалог. Плагинный пакет DeepSeek Harness добавляет долговременный сбор наблюдений, регрессионные кейсы с подтверждением, изолированные запуски и сравнение статусов. GitHub Action в корне репозитория запускает оценки на pull request across engines; это действие-контейнер Docker, требующее Linux-раннера и учётных данных модели, хранимых как секрет, и оно фиксирует неизменяемый дайджест образа. Пользовательская конфигурация задаёт переменные окружения OpenTelemetry по умолчанию и kwargs среды выполнения для каждого окружения, с цепочкой обнаружения от встроенных значений по умолчанию через пользовательские и проектные файлы до явного пути --config. Секреты должны указываться через ${ENV_VAR}, а не литералами. CLI предоставляет подкоманды run, validate, list-cases, report, import и debug. Проект написан на Go (>=1.25) и лицензирован под Apache 2.0.