Sobre el proyecto

DeepEval es un marco de evaluación de código abierto para sistemas de modelos de lenguaje extenso (LLM), que funciona de manera similar a Pytest pero especializado en aplicaciones de IA. Permite a los desarrolladores evaluar aplicaciones de LLM de extremo a extremo como cajas negras, analizar trayectorias completas de agentes o probar pasos individuales como el uso de herramientas y la recuperación de información. Las capacidades clave incluyen: - Una amplia gama de métricas listas para usar: - Personalizadas/Multipropósito: G-Eval y DAG. - Agénticas: Finalización de tareas, corrección de herramientas, precisión de objetivos y cumplimiento de planes. - RAG: Relevancia de respuesta, fidelidad, recuperación contextual y precisión contextual. - Multiturno: Retención de conocimiento, integridad de la conversación y cumplimiento de roles. - Multimodal: Texto a imagen, edición de imágenes y coherencia de imágenes. - Otros: Alucinación, resumen, sesgo, toxicidad y corrección de JSON. - Generación de conjuntos de datos sintéticos: Capacidad para crear conjuntos de datos de turno único y multiturno para pruebas. - Evaluación comparativa (Benchmarking): Soporte para puntos de referencia populares como MMLU, HellaSwag y HumanEval. - Optimización de prompts: Optimización automática de prompts basada en los resultados de la evaluación. - Integraciones amplias: Funciona con marcos como LangChain, LangGraph, Pydantic AI, CrewAI, LlamaIndex, OpenAI, Anthropic y Google ADK. El marco admite tanto la ejecución local a través de modelos de PNL como patrones de LLM-como-juez, y se integra en entornos CI/CD para el aseguramiento de calidad automatizado.