这个项目能做什么

DeepEval 是一个面向大型语言模型(LLM)系统的开源评估框架,功能类似 Pytest,但专为 AI 应用设计。它允许开发者以黑盒方式端到端评估 LLM 应用,分析完整智能体轨迹,或测试单个步骤如工具调用与检索。 主要能力包括: - 多种现成指标: - 通用型:G-Eval 和 DAG。 - 智能体型:任务完成度、工具正确性、目标准确性、计划遵循性。 - RAG 型:答案相关性、忠实度、上下文召回率、上下文精确率。 - 多轮对话型:知识保留、对话完整性、角色一致性。 - 多模态型:文本转图像、图像编辑、图像连贯性。 - 其他:幻觉检测、摘要质量、偏见、毒性、JSON 正确性。 - 合成数据集生成:可创建单轮或多轮测试数据集。 - 基准测试:支持 MMLU、HellaSwag、HumanEval 等主流基准。 - 提示词优化:基于评估结果自动优化提示词。 - 广泛集成:兼容 LangChain、LangGraph、Pydantic AI、CrewAI、LlamaIndex、OpenAI、Anthropic、Google ADK 等框架。 该框架支持本地 NLP 模型或 LLM-as-a-judge 模式执行,并可集成至 CI/CD 环境实现自动化质量保障。