عن المشروع
COSPA (تكلفة حل المهام البرمجية) هو إطار معياري مصمم لتقييم "نسبة التكلفة إلى الأداء" للوكلاء البرمجيين. ويقيس القدرة أو الجودة التي يوفرها النموذج لكل وحدة تكلفة من خلال تسجيل الإجابات الصحيحة، واستخدام الرموز، والوقت المنقضي، وتكاليف واجهة برمجة التطبيقات المقدرة.
يستفيد الإطار من لوحة رسمية مكونة من 336 مهمة تشمل ستة مجموعات معيارية:
- BigCodeBench-Hard Agentic: تنفيذ دالة بايثون.
- SWE-Explore Verified: تحديد موقع الشيفرة وملاءمتها.
- Multi-SWE-bench Flash: إصلاح مستودعات متعددة اللغات.
- Terminal-Bench Core: مهام إدارة الأنظمة والطرفية.
- SWE-PolyBench Verified: إصلاح المستودعات لـ Java وJS وPython وTypeScript.
- FeatureBench Lite: تنفيذ الميزات عبر مستودعات متنوعة.
لا يستضيف COSPA النماذج؛ بل يتطلب نقطة نهاية متوافقة مع OpenAI أو مزوّد خدمة مُكوَّن عبر عميل البرمجة Pi. ويتضمن نظام حماية مضيف متطور لإدارة موارد الأجهزة (RAM، القرص، PSI) أثناء تنفيذ المحاولات المتزامنة لضمان الاستقرار.
تشمل الميزات الرئيسية:
- دعم تكوينات وكلاء متعددة (محولات) مثل pi_vanilla وjouzu.
- تتبع مفصل للنتائج يشمل القوائم، وآثار النموذج، وأحكام المصحح.
- عارض مدمج لتحليل الدرجات، والتغطية، وفترات الثقة عبر واجهة سطر الأوامر أو المتصفح.
- معايير صارمة لاختيار المهام لضمان صحة الإصلاحات المرجعية وفشل المستودعات الابتدائية باستمرار.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.