프로젝트 소개

COSPA(Cost Of Solving Programming Assignments)는 코딩 에이전트의 "비용 대 성능"을 평가하기 위해 설계된 벤치마킹 프레임워크입니다. 정답률, 토큰 사용량, 경과 시간, 예상 API 비용을 기록하여 모델이 단위 비용당 제공하는 기능 또는 품질을 측정합니다. 프레임워크는 여섯 개의 벤치마크 스위트로 구성된 공식 336개 작업 패널을 활용합니다: - BigCodeBench-Hard Agentic: 파이썬 함수 구현. - SWE-Explore Verified: 코드 위치 및 관련성 식별. - Multi-SWE-bench Flash: 다중 언어 저장소 수리. - Terminal-Bench Core: 시스템 관리 및 터미널 작업. - SWE-PolyBench Verified: Java, JS, Python, TypeScript 저장소 수리. - FeatureBench Lite: 다양한 저장소에서의 기능 구현. COSPA는 모델을 호스팅하지 않으며, OpenAI와 호환되는 엔드포인트 또는 Pi 코딩 에이전트를 통해 구성된 공급자가 필요합니다. 동시 실행 중 하드웨어 리소스(RAM, Disk, PSI)를 관리하여 안정성을 보장하는 정교한 호스트 가드 시스템을 포함합니다. 주요 기능: - pi_vanilla 및 jouzu와 같은 다중 에이전트 구성(어댑터) 지원. - 매니페스트, 모델 추적, 채점 결과를 포함한 상세한 결과 추적. - 터미널 또는 브라우저 UI를 통해 점수, 커버리지, 신뢰 구간을 분석할 수 있는 내장 뷰어. - 참조 수정이 유효하고 시작 저장소가 일관되게 실패하는지 확인하기 위한 엄격한 작업 선택 기준.