这个项目能做什么
COSPA(Cost Of Solving Programming Assignments)是一个旨在评估编码代理“性价比”的基准测试框架。它通过记录正确答案、令牌使用量、耗时及预估API成本,衡量模型在单位成本下提供的能力或质量。
该框架采用官方336任务面板,包含六个基准测试套件:
- BigCodeBench-Hard Agentic:Python函数实现。
- SWE-Explore Verified:代码位置与相关性识别。
- Multi-SWE-bench Flash:多语言代码库修复。
- Terminal-Bench Core:系统管理与终端任务。
- SWE-PolyBench Verified:针对Java、JS、Python和TypeScript的代码库修复。
- FeatureBench Lite:跨多个代码库的功能实现。
COSPA不托管模型,需配置兼容OpenAI的端点或通过Pi编码代理设置的服务提供商。其内置先进的主机防护系统,可在并行测试执行期间管理硬件资源(RAM、Disk、PSI),确保稳定性。
主要功能包括:
- 支持多种代理配置(adapters)如pi_vanilla和jouzu。
- 详细结果追踪包含manifests、model traces及grader verdicts。
- 内置查看器可通过终端或浏览器UI分析scores、coverage和confidence intervals。
- 严格的任务筛选标准确保reference fixes有效且starter repositories持续失败。
评论
0 评分人数达到10人后显示
登录后参与讨论。