Sobre o projeto

O DeepEval é uma estrutura de avaliação de código aberto para sistemas de grandes modelos de linguagem (LLM), funcionando de forma semelhante ao Pytest, mas especializado em aplicações de IA. Ele permite que desenvolvedores avaliem aplicativos de LLM de ponta a ponta como caixas-pretas, analisem trajetórias completas de agentes ou testem etapas individuais, como o uso de ferramentas e a recuperação de dados. As principais capacidades incluem: - Uma ampla gama de métricas prontas para uso: - Personalizadas/Multiuso: G-Eval e DAG. - Agentes: Conclusão de Tarefas, Correção de Ferramentas, Precisão de Objetivos e Adesão ao Plano. - RAG: Relevância da Resposta, Fidelidade, Recall Contextual e Precisão Contextual. - Multi-turno: Retenção de Conhecimento, Completude da Conversa e Adesão ao Papel. - Multimodal: Texto para Imagem, Edição de Imagem e Coerência de Imagem. - Outros: Alucinação, Resumo, Viés, Toxicidade e Correção de JSON. - Geração de Conjuntos de Dados Sintéticos: Capacidade de criar conjuntos de dados de turno único e múltiplo para testes. - Benchmarking: Suporte para benchmarks populares como MMLU, HellaSwag e HumanEval. - Otimização de Prompt: Otimização automática de prompts com base nos resultados da avaliação. - Integrações Amplas: Funciona com estruturas como LangChain, LangGraph, Pydantic AI, CrewAI, LlamaIndex, OpenAI, Anthropic e Google ADK. A estrutura suporta tanto a execução local via modelos de PNL quanto padrões de LLM-como-juiz, e integra-se a ambientes de CI/CD para garantia de qualidade automatizada.