Об этом проекте

COSPA (Cost Of Solving Programming Assignments) — это бенчмаркинговая платформа, разработанная для оценки «соотношения стоимости и производительности» кодирующих агентов. Она измеряет объём возможностей или качество, предоставляемое моделью за единицу затрат, фиксируя правильные ответы, использование токенов, затраченное время и оценочные затраты на API. Платформа использует официальный набор из 336 задач, включающий шесть бенчмарков: - BigCodeBench-Hard Agentic: реализация функций на Python. - SWE-Explore Verified: определение местоположения кода и его релевантности. - Multi-SWE-bench Flash: ремонт репозиториев на нескольких языках. - Terminal-Bench Core: задачи системного администрирования и терминала. - SWE-PolyBench Verified: ремонт репозиториев для Java, JS, Python и TypeScript. - FeatureBench Lite: реализация функциональности в различных репозиториях. COSPA не размещает модели; требуется конечная точка, совместимая с OpenAI, или провайдер, настроенный через кодирующего агента Pi. Включает продвинутую систему защиты хоста для управления аппаратными ресурсами (RAM, Disk, PSI) при параллельном выполнении испытаний с целью обеспечения стабильности. Ключевые особенности: - Поддержка различных конфигураций агентов (адаптеров), таких как pi_vanilla и jouzu. - Детальный учёт результатов, включая манифесты, трассировки моделей и вердикты проверяющих. - Встроенный просмотрщик для анализа оценок, покрытия и доверительных интервалов через терминал или браузерный интерфейс. - Строгие критерии отбора задач для гарантии валидности эталонных исправлений и стабильного воспроизведения сбоев в стартовых репозиториях.