À propos du projet

Agent Eval Harness est une suite de benchmarks open source et en direct qui évalue les agents de codage IA (comme OpenCode, Codex et Claude Code) sur des tickets GitHub réels accompagnés d'étapes de reproduction. Contrairement aux benchmarks académiques statiques, il fournit un classement public mis à jour chaque semaine, rafraîchi automatiquement toutes les 15 minutes via une tâche cron GitHub Actions. Le dépôt suit plus de 100 éléments, répertoriant les dépôts pertinents pour l'évaluation des agents IA, les évaluations LLM et les outils associés, avec des détails tels que les étoiles, le langage et la dernière mise à jour. Les données proviennent de l'API GitHub Search, et le tableau est réécrit à chaque déclenchement du cron. Le projet vise à offrir une comparaison actuelle et fiable des performances des agents dans des scénarios réalistes, sans nécessiter de services externes ni d'API payantes.