इस प्रोजेक्ट के बारे में
COSPA (Cost Of Solving Programming Assignments) एक मानकीकरण ढांचा है जो कोडिंग एजेंट्स के "लागत-प्रदर्शन" का मूल्यांकन करने के लिए डिज़ाइन किया गया है। यह सही उत्तर, टोकन उपयोग, बीता समय और अनुमानित API लागत को रिकॉर्ड करके मॉडल द्वारा प्रति इकाई लागत प्रदान की गई क्षमता या गुणवत्ता को मापता है।
यह ढांचा छह मानक सूट से मिलकर बने आधिकारिक 336-कार्य पैनल का उपयोग करता है:
- BigCodeBench-Hard Agentic: पायथन फ़ंक्शन कार्यान्वयन।
- SWE-Explore Verified: कोड स्थान और प्रासंगिकता पहचान।
- Multi-SWE-bench Flash: बहु-भाषा रिपॉजिटरी मरम्मत।
- Terminal-Bench Core: सिस्टम प्रशासन और टर्मिनल कार्य।
- SWE-PolyBench Verified: जावा, JS, पायथन और टाइपस्क्रिप्ट के लिए रिपॉजिटरी मरम्मत।
- FeatureBench Lite: विभिन्न रिपॉजिटरी में सुविधा कार्यान्वयन।
COSPA मॉडल्स की होस्टिंग नहीं करता है; इसके लिए Pi कोडिंग एजेंट के माध्यम से कॉन्फ़िगर किए गए OpenAI-अनुकूलित एंडपॉइंट या प्रदाता की आवश्यकता होती है। यह स्थिरता सुनिश्चित करने के लिए उन्नत होस्ट गार्ड प्रणाली शामिल करता है जो समानांतर परीक्षण निष्पादन के दौरान हार्डवेयर संसाधनों (RAM, Disk, PSI) का प्रबंधन करती है।
मुख्य विशेषताएं शामिल हैं:
- pi_vanilla और jouzu जैसे कई एजेंट कॉन्फ़िगरेशन (एडाप्टर) का समर्थन।
- मैनिफेस्ट, मॉडल ट्रेस और ग्रेडर निर्णय सहित विस्तृत परिणाम ट्रैकिंग।
- टर्मिनल या ब्राउज़र UI के माध्यम से स्कोर, कवरेज और आत्मविश्वास अंतराल का विश्लेषण करने के लिए एक अंतर्निर्मित व्यूअर।
- सख्त कार्य चयन मानदंड जो यह सुनिश्चित करते हैं कि संदर्भ सुधार मान्य हैं और स्टार्टर रिपॉजिटरी लगातार विफल हो रही हैं।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.