منصوبے کے بارے میں

COSPA (پروگرامنگ تفویضات کو حل کرنے کی لاگت) ایک بینچ مارکنگ فریم ورک ہے جو کوڈنگ ایجنٹس کی "کارکردگی کی لاگت" کا اندازہ لگانے کے لیے ڈیزائن کیا گیا ہے۔ یہ ماڈل کی صلاحیت یا معیار کو فی یونٹ لاگت کے حساب سے ناپتا ہے، جس میں درست جوابات، ٹوکن استعمال، گزرے وقت اور تخمینی API لاگت کو ریکارڈ کیا جاتا ہے۔ یہ فریم ورک سرکاری 336 کاموں پر مشتمل ایک پینل کا استعمال کرتا ہے جو چھ بینچ مارک سویٹس پر مشتمل ہے: - BigCodeBench-Hard Agentic: پائتھون فنکشن کا نفاذ۔ - SWE-Explore Verified: کوڈ کی لوکیشن اور متعلقہ شناخت۔ - Multi-SWE-bench Flash: ملٹی-لینگویج ریپوزیٹری مرمت۔ - Terminal-Bench Core: سسٹم انتظامیہ اور ٹرمینل کام۔ - SWE-PolyBench Verified: جاوا، جے ایس، پائتھون، اور ٹائپ اسکرپٹ کے لیے ریپوزیٹری مرمت۔ - FeatureBench Lite: مختلف ریپوزیٹریز میں فیچر نفاذ۔ COSPA ماڈلز کی میزبانی نہیں کرتا؛ اس کے لیے OpenAI مطابق اینڈ پوائنٹ یا Pi کوڈنگ ایجنٹ کے ذریعے کنفیگر کیا گیا فراہم کنندہ درکار ہوتا ہے۔ یہ استحکام یقینی بنانے کے لیے متوازی ٹرائل ایکزیکیوشن کے دوران ہارڈ ویئر وسائل (RAM، ڈسک، PSI) کو مینیج کرنے کے لیے ایک پیچیدہ ہوسٹ گارڈ سسٹم شامل کرتا ہے۔ اہم خصوصیات میں شامل ہیں: - pi_vanilla اور jouzu جیسے متعدد ایجنٹ کنفیگریشنز (ایڈاپٹرز) کی حمایت۔ - مینیفیسٹس، ماڈل ٹریسز، اور گریڈر فیصلوں سمیت تفصیلی نتائج کی نگرانی۔ - اسکورز، کوریج، اور کانفیڈنس انٹروالز کا تجزیہ کرنے کے لیے ٹرمینل یا براؤزر UI کے ذریعے ایک بیلٹ-ان ویور۔ - سخت کام کے انتخاب کے معیارات تاکہ حوالہ فکسز درست ہوں اور ابتدائی ریپوزیٹریز مسلسل ناکام ہوں۔