このプロジェクトについて
Agent Eval Harnessは、AIコーディングエージェント(OpenCode、Codex、Claude Codeなど)を、再現手順付きの実世界のGitHub issueに対して評価する、ライブでオープンソースのベンチマークスイートです。静的な学術ベンチマークとは異なり、毎週更新される公開リーダーボードを提供し、GitHub Actionsのcronジョブによって15分ごとに自動的に更新されます。このリポジトリは100以上の項目を追跡し、AIエージェント評価、LLM evals、および関連ツールに関連するリポジトリを、スター数、言語、最終更新日などの詳細とともにリストしています。データはGitHub Search APIから取得され、テーブルはcronが実行されるたびに書き換えられます。このプロジェクトは、外部サービスや有料APIを必要とせず、現実的なシナリオにおけるエージェントのパフォーマンスについて、最新で信頼できる比較を提供することを目指しています。
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.