프로젝트 소개

Proving Ground는 마케팅 주장이 아닌 행동 증거를 기반으로 AI 에이전트를 등급화하는 표준화된 방법론을 제공합니다. 이 프레임워크는 보안, 작업 성공, grounding, 안전성, 편향성, 개인정보 보호, 지침 준수, 대화 품질, 정직성, 견고성, 메모리, 지연 시간 등 12가지 차원에서 에이전트를 평가합니다. 주요 기술적 특징은 다음과 같습니다: - Adapters: REST API 및 Socket.IO를 통한 블랙박스 상호작용을 지원하며, 브라우저 기반의 WidgetAdapter가 계획되어 있습니다. - Grading Pipeline: 이진 팩트(예: 비밀 유출, 지연 시간)에 대한 결정론적 검사와 정성적 평가를 위한 LLM-as-judge 앙상블(Claude 활용)을 결합하여 사용합니다. - Anti-Gaming Measures: 벤더의 자체 테스트를 위한 공개 연습 세트와 과도한 튜닝을 방지하기 위한 최종 인증용 비공개 홀드아웃 세트를 운용합니다. - Certification Tiers: 종합 점수와 각 차원별 최소 성능 하한선을 기준으로 Standard, Premium 또는 Elite 티어를 부여합니다. - Verification: 에이전트가 단순히 수행했다고 주장하는 것이 아니라 실제로 동작(예: 예약 또는 이메일 발송)을 수행하는지 확인하기 위한 도구 실행 등급 평가를 포함합니다.