عن المشروع
يوفر Proving Ground منهجية موحدة لتصنيف وكلاء الذكاء الاصطناعي بناءً على الأدلة السلوكية بدلاً من الادعاءات التسويقية. وهو يقيم الوكلاء عبر اثني عشر بُعداً، تشمل الأمن، ونجاح المهمة، والترسيخ (grounding)، والسلامة، والتحيز، والخصوصية، واتباع التعليمات، وجودة المحادثة، والأمانة، والمتانة، والذاكرة، وزمن الاستجابة (latency).
تشمل الميزات التقنية الرئيسية ما يلي:
- المحولات (Adapters): يدعم التفاعل بنظام الصندوق الأسود عبر REST API و Socket.IO، مع التخطيط لإضافة WidgetAdapter مستند إلى المتصفح.
- خط أنابيب التصنيف (Grading Pipeline): يستخدم مزيجاً من الفحوصات الحتمية للحقائق الثنائية (مثل تسريبات الأسرار، وزمن الاستجابة) ومجموعة من نماذج LLM-as-judge (باستخدام Claude) للتقييم النوعي.
- تدابير مكافحة التلاعب: يستخدم مجموعة تدريب عامة لاختبار الموردين لأنفسهم، ومجموعة خاصة ومحتجزة للاعتماد النهائي لمنع الضبط المفرط (over-tuning).
- مستويات الاعتماد: يخصص مستويات Standard أو Premium أو Elite بناءً على الدرجات المركبة والحد الأدنى من الأداء عبر الأبعاد المختلفة.
- التحقق: يتضمن تصنيف تنفيذ الأدوات للتحقق من أن الوكلاء يقومون بالفعل بتنفيذ الإجراءات (مثل الحجز أو إرسال البريد الإلكتروني) بدلاً من مجرد الادعاء بالقيام بذلك.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.