À propos du projet

COSPA (Cost Of Solving Programming Assignments) est un framework de benchmarking conçu pour évaluer le « coût-performance » des agents de codage. Il mesure la capacité ou la qualité qu'un modèle offre par unité de coût en enregistrant les réponses correctes, l'utilisation de tokens, le temps écoulé et les coûts API estimés. Le framework utilise un panel officiel de 336 tâches comprenant six suites de benchmark : - BigCodeBench-Hard Agentic : Implémentation de fonctions Python. - SWE-Explore Verified : Identification de l'emplacement et de la pertinence du code. - Multi-SWE-bench Flash : Réparation de dépôts multi-langages. - Terminal-Bench Core : Tâches d'administration système et de terminal. - SWE-PolyBench Verified : Réparation de dépôts pour Java, JS, Python et TypeScript. - FeatureBench Lite : Implémentation de fonctionnalités dans divers dépôts. COSPA n'héberge pas de modèles ; il nécessite un endpoint compatible OpenAI ou un fournisseur configuré via l'agent de codage Pi. Il inclut un système de garde d'hôte sophistiqué pour gérer les ressources matérielles (RAM, Disque, PSI) lors de l'exécution simultanée d'essais afin d'assurer la stabilité. Fonctionnalités clés : - Prise en charge de multiples configurations d'agents (adapters) comme pi_vanilla et jouzu. - Suivi détaillé des résultats incluant les manifestes, traces des modèles et verdicts des correcteurs. - Un visualiseur intégré pour analyser les scores, la couverture et les intervalles de confiance via une interface terminal ou navigateur. - Critères rigoureux de sélection des tâches pour garantir que les correctifs de référence sont valides et que les dépôts initiaux échouent systématiquement.