عن المشروع
Agent Eval Harness هو مجموعة معايير مباشرة ومفتوحة المصدر تقيّم وكلاء البرمجة بالذكاء الاصطناعي (مثل OpenCode وCodex وClaude Code) مقابل قضايا GitHub الواقعية المزوّدة بخطوات إعادة الإنتاج. وخلافًا للمعايير الأكاديمية الثابتة، فإنه يوفّر لوحة صدارة عامة تُحدَّث أسبوعيًا، وتُحدَّث تلقائيًا كل 15 دقيقة عبر مهمة cron في GitHub Actions. يتتبّع المستودع أكثر من 100 عنصر، ويسرد مستودعات ذات صلة بتقييم وكلاء الذكاء الاصطناعي وتقييمات LLM والأدوات المرتبطة بها، مع تفاصيل مثل النجوم واللغة وآخر تحديث. تُستمد البيانات من GitHub Search API، ويُعاد كتابة الجدول عند كل دورة cron. يهدف المشروع إلى تقديم مقارنة حديثة وموثوقة لأداء الوكلاء في سيناريوهات واقعية، دون الحاجة إلى خدمات خارجية أو واجهات API مدفوعة.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.