इस प्रोजेक्ट के बारे में

skill-up, Agent Skills, एजेंट और उनके वर्कस्पेस के मूल्यांकन के लिए एक कमांड-लाइन टूल है। यह एक Agent Engine पर declarative मूल्यांकन केस चलाता है, प्रतिक्रिया और किसी भी वर्कस्पेस बदलाव को grade करता है, और स्थानीय रूप से या CI में रिपोर्ट तैयार करता है। तीन मूल्यांकन मोड बताए गए हैं: Skill मूल्यांकन, जो केसों में एक Skill के व्यवहार को मापता है और Skill के साथ और बिना चलाए गए रनों की तुलना कर सकता है; Agent मूल्यांकन, जो किसी Skill को इंस्टॉल किए बिना वही केस चलाकर किसी इंजन या कस्टम एजेंट का स्वतंत्र मूल्यांकन करता है; और Workspace मूल्यांकन, जो केस fixtures या मौजूदा स्थानीय वर्कस्पेस का उपयोग करके यह जाँचता है कि एजेंट फ़ाइलों और रिपॉज़िटरी के साथ कैसे काम करता है। कॉन्फ़िगरेशन declarative YAML है: एक eval.yaml और cases/*.yaml फ़ाइलें वातावरण, इंजन, मॉडल और केस परिभाषित करती हैं। टूल प्रति केस एक स्थानीय, Docker या OpenSandbox रनटाइम प्रोविज़न करता है, समर्थित इंजनों में कॉन्फ़िगर किए गए वास्तविक या mocked MCP सर्वर इंस्टॉल कर सकता है, और context.repo_fixture तथा context.files को वर्कस्पेस में अपलोड कर सकता है। रन skill-optional हो सकते हैं, और --workspace के साथ किसी मौजूदा स्थानीय डायरेक्टरी को लक्षित किया जा सकता है (जिसके लिए environment.type: none, एक बार में एक केस, और benchmark मोड बंद होना आवश्यक है)। अंतर्निहित Agent Engines में Qoder CLI, Claude Code और Codex शामिल हैं, तथा स्थानीय ट्रांसपोर्ट पर engine.custom के माध्यम से उपयोगकर्ता-परिभाषित एजेंट समर्थित हैं। Judging rule_based, script और agent_judge रणनीतियों का समर्थन करता है। रिपोर्ट में Anthropic-संगत grading.json और benchmark.json, benchmark.md, साथ ही result.json, JUnit XML और HTML आउटपुट शामिल हैं। एक import कमांड Anthropic-शैली के evals.json को YAML लेआउट में माइग्रेट करता है, और --auto इसे स्वतः पहचान सकता है। रिपॉज़िटरी में skill-upper नामक एक साथी Skill भेजी जाती है और इसका उद्देश्य eval-to-evolution लूप को बंद करना है: यह विफलताओं का निरीक्षण करती है, eval सूट की मरम्मत या विस्तार करती है, और बातचीत के माध्यम से skill-up को फिर से चलाती है। एक DeepSeek Harness प्लगइन बंडल टिकाऊ observation capture, approval-gated regression केस, पृथक रन और स्थिति तुलना जोड़ता है। रिपॉज़िटरी रूट पर एक GitHub Action pull requests पर इंजनों में evals चलाता है; यह एक Docker कंटेनर action है जिसके लिए Linux रनर और secret के रूप में संग्रहीत मॉडल क्रेडेंशियल आवश्यक है, और यह एक अपरिवर्तनीय image digest को pin करता है। एक उपयोगकर्ता-स्तरीय कॉन्फ़िग डिफ़ॉल्ट OpenTelemetry पर्यावरण चर और प्रति-पर्यावरण runtime kwargs प्रदान करता है, जिसमें embedded defaults से लेकर उपयोगकर्ता और प्रोजेक्ट फ़ाइलों तक और स्पष्ट --config पथ तक एक discovery श्रृंखला होती है। Secrets को literals के बजाय ${ENV_VAR} के माध्यम से संदर्भित करने की अपेक्षा है। CLI run, validate, list-cases, report, import और debug उपकमांड प्रदान करता है। प्रोजेक्ट Go (>=1.25) में लिखा गया है और Apache 2.0 के अंतर्गत लाइसेंस प्राप्त है।