منصوبے کے بارے میں

ایجنٹ ایول ہارنس (Agent Eval Harness) ایک لائیو، اوپن سورس بینچ مارک سوٹ ہے جو AI کوڈنگ ایجنٹوں (جیسے OpenCode، Codex اور Claude Code) کا حقیقی دنیا کے GitHub مسائل کے خلاف تشخیص کرتا ہے جن میں دوبارہ پیدا کرنے کے اقدامات موجود ہیں۔ جامد تعلیمی بینچ مارکس کے برعکس، یہ ہفتہ وار اپ ڈیٹ ہونے والا پبلک لیڈر بورڈ فراہم کرتا ہے، جو GitHub Actions کرون جاب کے ذریعے ہر 15 منٹ میں خودکار طور پر تازہ ہوتا ہے۔ یہ ریپوزٹری 100 سے زیادہ آئٹمز کو ٹریک کرتا ہے، AI ایجنٹ تشخیص، LLM ایولز اور متعلقہ ٹولز سے متعلق ریپوزٹریز کی فہرست پیش کرتا ہے، جس میں ستارے، زبان اور آخری اپ ڈیٹ جیسی تفصیلات شامل ہیں۔ ڈیٹا GitHub سرچ API سے حاصل کیا جاتا ہے، اور ہر کرون ٹک پر ٹیبل دوبارہ لکھا جاتا ہے۔ اس پروجیکٹ کا مقصد حقیقی منظرناموں میں ایجنٹ کی کارکردگی کا موجودہ، قابل اعتماد موازنہ پیش کرنا ہے، جس کے لیے کوئی بیرونی سروس یا ادا شدہ API کی ضرورت نہیں ہوتی۔