Sobre o projeto
O Proving Ground fornece uma metodologia padronizada para a classificação de agentes de IA com base em evidências comportamentais, em vez de alegações de marketing. Ele avalia os agentes em doze dimensões, incluindo segurança, sucesso na tarefa, grounding, safety, viés, privacidade, seguimento de instruções, qualidade conversacional, honestidade, robustez, memória e latência.
Os principais recursos técnicos incluem:
- Adapters: Suporta interação de caixa preta via REST API e Socket.IO, com um WidgetAdapter baseado em navegador planejado.
- Grading Pipeline: Utiliza uma combinação de verificações determinísticas para fatos binários (ex: vazamentos de segredos, latência) e um ensemble de LLM-as-judge (utilizando Claude) para avaliação qualitativa.
- Medidas Anti-Gaming: Emprega um conjunto de prática público para autoteste do fornecedor e um conjunto privado e reservado para a certificação final, a fim de evitar o over-tuning.
- Certification Tiers: Atribui os níveis Standard, Premium ou Elite com base em pontuações compostas e pisos de desempenho mínimo em todas as dimensões.
- Verificação: Inclui a classificação de execução de ferramentas para verificar se os agentes realmente realizam ações (ex: reservas ou envio de e-mails) em vez de apenas alegarem que o fizeram.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.