このプロジェクトについて
skill-upは、Agent Skills、エージェント、およびそれらのワークスペースを評価するためのコマンドラインツールです。宣言的な評価ケースをAgent Engineに対して実行し、応答とワークスペースの変更を採点し、ローカルまたはCIでレポートを生成します。
3つの評価モードが説明されています。Skill評価は、ケース全体にわたるSkillの動作を測定し、Skillありとなしの実行を比較できます。Agent評価は、Skillをインストールせずに同じケースを実行し、エンジンまたはカスタムエージェント自体を評価します。Workspace評価は、ケースフィクスチャまたは既存のローカルワークスペースを使用して、エージェントがファイルやリポジトリをどのように扱うかを確認します。
設定は宣言的なYAMLです。eval.yamlとcases/*.yamlファイルが、環境、エンジン、モデル、ケースを定義します。このツールはケースごとにローカル、Docker、またはOpenSandboxランタイムをプロビジョニングし、設定された実またはモックのMCPサーバーをサポート対象エンジンにインストールでき、context.repo_fixtureとcontext.filesをワークスペースにアップロードできます。実行はskill-optionalにでき、既存のローカルディレクトリは--workspaceで対象にできます(environment.type: none、一度に1ケース、ベンチマークモードオフが必要)。
組み込みのAgent EnginesにはQoder CLI、Claude Code、Codexが含まれ、ユーザー定義エージェントはローカルトランスポート経由でengine.customを通じてサポートされます。ジャッジはrule_based、script、agent_judge戦略をサポートします。レポートにはAnthropic互換のgrading.jsonとbenchmark.json、benchmark.md、さらにresult.json、JUnit XML、HTML出力が含まれます。importコマンドはAnthropic形式のevals.jsonをYAMLレイアウトに移行し、--autoで自動検出できます。
skill-upperと呼ばれるコンパニオンSkillがリポジトリに同梱されており、eval-to-evolutionループを閉じることを目的としています。これは失敗を検査し、評価スイートを修復または拡張し、会話を通じてskill-upを再実行します。DeepSeek Harnessプラグインバンドルは、永続的な観察キャプチャ、承認ゲート付き回帰ケース、分離実行、ステータス比較を追加します。リポジトリルートのGitHub Actionは、プルリクエスト上でエンジン横断的に評価を実行します。これはDockerコンテナアクションであり、Linuxランナーとシークレットとして保存されたモデル資格情報が必要で、不変のイメージダイジェストを固定します。
ユーザーレベルの設定は、デフォルトのOpenTelemetry環境変数と環境ごとのランタイムkwargsを提供し、埋め込みデフォルトからユーザーおよびプロジェクトファイル、明示的な--configパスへの探索チェーンを持ちます。シークレットはリテラルではなく${ENV_VAR}経由で参照することが想定されています。CLIはrun、validate、list-cases、report、import、debugサブコマンドを公開しています。このプロジェクトはGo(>=1.25)で書かれ、Apache 2.0の下でライセンスされています。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.