Sobre o projeto
O Agent Eval Harness é uma suíte de benchmark ao vivo e de código aberto que avalia agentes de codificação com IA (como OpenCode, Codex e Claude Code) em issues do mundo real do GitHub com etapas de reprodução. Ao contrário dos benchmarks acadêmicos estáticos, ele oferece um leaderboard público atualizado semanalmente, atualizado automaticamente a cada 15 minutos por meio de um cron job do GitHub Actions. O repositório rastreia mais de 100 itens, listando repositórios relevantes para avaliação de agentes de IA, avaliações de LLM e ferramentas relacionadas, com detalhes como estrelas, linguagem e última atualização. Os dados são obtidos da GitHub Search API, e a tabela é reescrita a cada execução do cron. O projeto tem como objetivo oferecer uma comparação atual e confiável do desempenho dos agentes em cenários realistas, sem necessidade de serviços externos ou APIs pagas.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.