这个项目能做什么
Proving Ground 提供了一套标准化的方法论,基于行为证据而非营销主张来对 AI agent 进行评分。它从十二个维度对 agent 进行评估,包括安全性、任务成功率、 grounding、安全、偏见、隐私、指令遵循、对话质量、诚实度、鲁棒性、记忆力和延迟。
关键技术特性包括:
- Adapters:支持通过 REST API 和 Socket.IO 进行黑盒交互,并计划推出基于浏览器的 WidgetAdapter。
- Grading Pipeline:结合了针对二进制事实(如密钥泄露、延迟)的确定性检查,以及用于定性评估的 LLM-as-judge 集成方案(利用 Claude)。
- Anti-Gaming Measures:采用公开的练习集供供应商自测,并使用私有的保留集进行最终认证,以防止过度调优。
- Certification Tiers:根据综合得分和各维度的最低性能底线,授予 Standard、Premium 或 Elite 等级。
- Verification:包含工具执行评分,以验证 agent 实际上执行了操作(如预订或发送电子邮件),而不仅仅是声称已执行。
评论
0 评分人数达到10人后显示
登录后参与讨论。