منصوبے کے بارے میں
Proving Ground مارکیٹنگ کے دعوؤں کے بجائے رویے کے شواہد کی بنیاد پر AI ایجنٹس کی درجہ بندی کے لیے ایک معیاری طریقہ کار فراہم کرتا ہے۔ یہ بارہ جہتوں پر ایجنٹس کا جائزہ لیتا ہے، جن میں سیکیورٹی، ٹاسک کی کامیابی، grounding، حفاظت، تعصب، پرائیویسی، ہدایات پر عمل درآمد، بات چیت کا معیار، ایمانداری، مضبوطی، میموری اور latency شامل ہیں۔
اہم تکنیکی خصوصیات میں شامل ہیں:
- Adapters: REST API اور Socket.IO کے ذریعے بلیک بکس تعامل کی حمایت کرتا ہے، جبکہ براؤزر پر مبنی WidgetAdapter کی منصوبہ بندی کی گئی ہے۔
- Grading Pipeline: بائنری حقائق (مثلاً خفیہ معلومات کا لیک ہونا، latency) کے لیے یقینی چیکس اور معیاری تشخیص کے لیے LLM-as-judge ensemble (Claude کا استعمال کرتے ہوئے) کے امتزاج کا استعمال کرتا ہے۔
- Anti-Gaming Measures: وینڈر کی اپنی ٹیسٹنگ کے لیے ایک عوامی پریکٹس سیٹ اور حتمی سرٹیفیکیشن کے لیے ایک نجی، محفوظ سیٹ استعمال کرتا ہے تاکہ اوور ٹیوننگ کو روکا جا سکے۔
- Certification Tiers: مجموعی اسکورز اور مختلف جہتوں میں کم از کم کارکردگی کی بنیاد پر Standard، Premium، یا Elite ٹیرز تفویض کرتا ہے۔
- Verification: ٹول-ایگزیکیوشن گریڈنگ شامل ہے تاکہ اس بات کی تصدیق کی جا سکے کہ ایجنٹس واقعی اقدامات (مثلاً بکنگ یا ای میلنگ) کرتے ہیں، نہ کہ صرف ایسا کرنے کا دعویٰ کرتے ہیں۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.