Sobre el proyecto
DeepEval es un marco de evaluación de código abierto para sistemas de modelos de lenguaje extenso (LLM), que funciona de manera similar a Pytest pero especializado en aplicaciones de IA. Permite a los desarrolladores evaluar aplicaciones de LLM de extremo a extremo como cajas negras, analizar trayectorias completas de agentes o probar pasos individuales como el uso de herramientas y la recuperación de información.
Las capacidades clave incluyen:
- Una amplia gama de métricas listas para usar:
- Personalizadas/Multipropósito: G-Eval y DAG.
- Agénticas: Finalización de tareas, corrección de herramientas, precisión de objetivos y cumplimiento de planes.
- RAG: Relevancia de respuesta, fidelidad, recuperación contextual y precisión contextual.
- Multiturno: Retención de conocimiento, integridad de la conversación y cumplimiento de roles.
- Multimodal: Texto a imagen, edición de imágenes y coherencia de imágenes.
- Otros: Alucinación, resumen, sesgo, toxicidad y corrección de JSON.
- Generación de conjuntos de datos sintéticos: Capacidad para crear conjuntos de datos de turno único y multiturno para pruebas.
- Evaluación comparativa (Benchmarking): Soporte para puntos de referencia populares como MMLU, HellaSwag y HumanEval.
- Optimización de prompts: Optimización automática de prompts basada en los resultados de la evaluación.
- Integraciones amplias: Funciona con marcos como LangChain, LangGraph, Pydantic AI, CrewAI, LlamaIndex, OpenAI, Anthropic y Google ADK.
El marco admite tanto la ejecución local a través de modelos de PNL como patrones de LLM-como-juez, y se integra en entornos CI/CD para el aseguramiento de calidad automatizado.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.