Sobre el proyecto
Agent Eval Harness es una suite de benchmark en vivo y de código abierto que evalúa agentes de IA para programar (como OpenCode, Codex y Claude Code) frente a problemas reales de GitHub con pasos de reproducción. A diferencia de los benchmarks académicos estáticos, ofrece una tabla de clasificación pública actualizada semanalmente y renovada automáticamente cada 15 minutos mediante un cron job de GitHub Actions. El repositorio rastrea más de 100 elementos, enumerando repositorios relevantes para la evaluación de agentes de IA, evaluaciones de LLM y herramientas relacionadas, con detalles como estrellas, lenguaje y última actualización. Los datos provienen de la API de búsqueda de GitHub y la tabla se reescribe en cada ejecución del cron. El proyecto tiene como objetivo ofrecer una comparación actual y confiable del rendimiento de los agentes en escenarios realistas, sin necesidad de servicios externos ni API de pago.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.