Sobre o projeto
COSPA (Cost Of Solving Programming Assignments) é um framework de benchmarking projetado para avaliar o "custo-desempenho" de agentes de programação. Ele mede quanta capacidade ou qualidade um modelo oferece por unidade de custo, registrando respostas corretas, uso de tokens, tempo decorrido e custos estimados de API.
O framework utiliza um painel oficial de 336 tarefas composto por seis suítes de benchmark:
- BigCodeBench-Hard Agentic: Implementação de funções Python.
- SWE-Explore Verified: Identificação de localização e relevância de código.
- Multi-SWE-bench Flash: Reparo de repositórios em múltiplas linguagens.
- Terminal-Bench Core: Tarefas de administração de sistemas e terminal.
- SWE-PolyBench Verified: Reparo de repositórios para Java, JS, Python e TypeScript.
- FeatureBench Lite: Implementação de funcionalidades em vários repositórios.
O COSPA não hospeda modelos; requer um endpoint compatível com OpenAI ou um provedor configurado via agente de programação Pi. Ele inclui um sistema sofisticado de proteção de host para gerenciar recursos de hardware (RAM, Disco, PSI) durante execuções concorrentes de testes para garantir estabilidade.
Principais recursos incluem:
- Suporte para múltiplas configurações de agentes (adaptadores) como pi_vanilla e jouzu.
- Rastreamento detalhado de resultados, incluindo manifestos, rastros do modelo e vereditos do avaliador.
- Visualizador integrado para analisar pontuações, cobertura e intervalos de confiança via terminal ou interface do navegador.
- Critérios rigorosos de seleção de tarefas para garantir que os reparos de referência sejam válidos e que os repositórios iniciais falhem consistentemente.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.