这个项目能做什么

Agent Eval Harness 是一套实时、开源的基准测试套件,用于评估 AI 编程代理(如 OpenCode、Codex 和 Claude Code)在带有复现步骤的真实 GitHub 问题上的表现。与静态学术基准不同,它提供每周更新的公开排行榜,并通过 GitHub Actions 定时任务每 15 分钟自动刷新。该仓库跟踪 100 多个条目,列出与 AI 代理评估、LLM 评估及相关工具相关的仓库,并包含星标数、语言和最后更新时间等详细信息。数据来源于 GitHub Search API,表格会在每次定时任务触发时重写。该项目旨在提供当前、可靠的代理在真实场景中的性能对比,且无需外部服务或付费 API。