这个项目能做什么

COSPA(Cost Of Solving Programming Assignments)是一个旨在评估编码代理“性价比”的基准测试框架。它通过记录正确答案、令牌使用量、耗时及预估API成本,衡量模型在单位成本下提供的能力或质量。 该框架采用官方336任务面板,包含六个基准测试套件: - BigCodeBench-Hard Agentic:Python函数实现。 - SWE-Explore Verified:代码位置与相关性识别。 - Multi-SWE-bench Flash:多语言代码库修复。 - Terminal-Bench Core:系统管理与终端任务。 - SWE-PolyBench Verified:针对Java、JS、Python和TypeScript的代码库修复。 - FeatureBench Lite:跨多个代码库的功能实现。 COSPA不托管模型,需配置兼容OpenAI的端点或通过Pi编码代理设置的服务提供商。其内置先进的主机防护系统,可在并行测试执行期间管理硬件资源(RAM、Disk、PSI),确保稳定性。 主要功能包括: - 支持多种代理配置(adapters)如pi_vanilla和jouzu。 - 详细结果追踪包含manifests、model traces及grader verdicts。 - 内置查看器可通过终端或浏览器UI分析scores、coverage和confidence intervals。 - 严格的任务筛选标准确保reference fixes有效且starter repositories持续失败。