Sobre el proyecto
COSPA (Cost Of Solving Programming Assignments) es un marco de referencia diseñado para evaluar el "costo-rendimiento" de los agentes de programación. Mide cuánta capacidad o calidad proporciona un modelo por unidad de costo registrando respuestas correctas, uso de tokens, tiempo transcurrido y costos estimados de API.
El marco utiliza un panel oficial de 336 tareas que comprende seis suites de benchmark:
- BigCodeBench-Hard Agentic: Implementación de funciones en Python.
- SWE-Explore Verified: Identificación de ubicación y relevancia del código.
- Multi-SWE-bench Flash: Reparación de repositorios en múltiples lenguajes.
- Terminal-Bench Core: Administración de sistemas y tareas de terminal.
- SWE-PolyBench Verified: Reparación de repositorios para Java, JS, Python y TypeScript.
- FeatureBench Lite: Implementación de funciones en diversos repositorios.
COSPA no aloja modelos; requiere un endpoint compatible con OpenAI o un proveedor configurado a través del agente de programación Pi. Incluye un sofisticado sistema de host guard para gestionar los recursos de hardware (RAM, Disco, PSI) durante las ejecuciones de pruebas concurrentes para garantizar la estabilidad.
Las características clave incluyen:
- Soporte para múltiples configuraciones de agentes (adaptadores) como pi_vanilla y jouzu.
- Seguimiento detallado de resultados, incluyendo manifiestos, trazas del modelo y veredictos del calificador.
- Un visor integrado para analizar puntuaciones, cobertura e intervalos de confianza a través de la terminal o la interfaz de usuario del navegador.
- Criterios rigurosos de selección de tareas para asegurar que las correcciones de referencia sean válidas y que los repositorios iniciales fallen consistentemente.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.