Об этом проекте
COSPA (Cost Of Solving Programming Assignments) — это бенчмаркинговая платформа, разработанная для оценки «соотношения стоимости и производительности» кодирующих агентов. Она измеряет объём возможностей или качество, предоставляемое моделью за единицу затрат, фиксируя правильные ответы, использование токенов, затраченное время и оценочные затраты на API.
Платформа использует официальный набор из 336 задач, включающий шесть бенчмарков:
- BigCodeBench-Hard Agentic: реализация функций на Python.
- SWE-Explore Verified: определение местоположения кода и его релевантности.
- Multi-SWE-bench Flash: ремонт репозиториев на нескольких языках.
- Terminal-Bench Core: задачи системного администрирования и терминала.
- SWE-PolyBench Verified: ремонт репозиториев для Java, JS, Python и TypeScript.
- FeatureBench Lite: реализация функциональности в различных репозиториях.
COSPA не размещает модели; требуется конечная точка, совместимая с OpenAI, или провайдер, настроенный через кодирующего агента Pi. Включает продвинутую систему защиты хоста для управления аппаратными ресурсами (RAM, Disk, PSI) при параллельном выполнении испытаний с целью обеспечения стабильности.
Ключевые особенности:
- Поддержка различных конфигураций агентов (адаптеров), таких как pi_vanilla и jouzu.
- Детальный учёт результатов, включая манифесты, трассировки моделей и вердикты проверяющих.
- Встроенный просмотрщик для анализа оценок, покрытия и доверительных интервалов через терминал или браузерный интерфейс.
- Строгие критерии отбора задач для гарантии валидности эталонных исправлений и стабильного воспроизведения сбоев в стартовых репозиториях.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.