Sobre el proyecto

skill-up es una herramienta de línea de comandos para evaluar Agent Skills, agentes y sus espacios de trabajo. Ejecuta casos de evaluación declarativos contra un Agent Engine, califica la respuesta y cualquier cambio en el espacio de trabajo, y produce informes ya sea localmente o en CI. Se describen tres modos de evaluación: evaluación de Skill, que mide el comportamiento de un Skill en distintos casos y puede comparar ejecuciones con y sin el Skill; evaluación de Agent, que ejecuta los mismos casos sin instalar un Skill para evaluar un motor o agente personalizado por sí solo; y evaluación de Workspace, que comprueba cómo trabaja un agente con archivos y repositorios utilizando fixtures de casos o un espacio de trabajo local existente. La configuración es YAML declarativo: un eval.yaml más archivos cases/*.yaml definen el entorno, el motor, el modelo y los casos. La herramienta aprovisiona un entorno de ejecución local, Docker u OpenSandbox por caso, puede instalar servidores MCP reales o simulados configurados en los motores compatibles, y puede subir context.repo_fixture y context.files al espacio de trabajo. Las ejecuciones pueden ser skill-optional, y se puede apuntar a un directorio local existente con --workspace (lo que requiere environment.type: none, un caso a la vez y el modo benchmark desactivado). Los Agent Engines integrados incluyen Qoder CLI, Claude Code y Codex, con soporte para agentes definidos por el usuario mediante engine.custom sobre transporte local. La evaluación admite estrategias rule_based, script y agent_judge. Los informes incluyen grading.json y benchmark.json compatibles con Anthropic, benchmark.md, además de result.json, XML JUnit y salida HTML. Un comando import migra evals.json de estilo Anthropic al diseño YAML, y --auto puede detectarlo automáticamente. Un Skill complementario llamado skill-upper se incluye en el repositorio y está destinado a cerrar un ciclo de evaluación a evolución: inspecciona fallos, repara o amplía el conjunto de evaluación y vuelve a ejecutar skill-up mediante conversación. Un paquete de plugins DeepSeek Harness añade captura de observación duradera, casos de regresión con aprobación, ejecuciones aisladas y comparación de estado. Una GitHub Action en la raíz del repositorio ejecuta evaluaciones en pull requests en varios motores; es una acción de contenedor Docker que requiere un runner Linux y una credencial de modelo almacenada como secreto, y fija un digest de imagen inmutable. Una configuración a nivel de usuario proporciona variables de entorno OpenTelemetry predeterminadas y kwargs de tiempo de ejecución por entorno, con una cadena de descubrimiento desde los valores predeterminados integrados, pasando por archivos de usuario y de proyecto, hasta una ruta --config explícita. Se espera que los secretos se referencien mediante ${ENV_VAR} en lugar de literales. La CLI expone los subcomandos run, validate, list-cases, report, import y debug. El proyecto está escrito en Go (>=1.25) y tiene licencia Apache 2.0.