프로젝트 소개
DeepEval은 대규모 언어 모델(LLM) 시스템을 위한 오픈 소스 평가 프레임워크로, Pytest와 유사하게 작동하지만 AI 애플리케이션에 특화되어 있습니다. 개발자는 LLM 앱을 블랙박스로 엔드투엔드로 평가하거나, 전체 에이전트 궤적을 분석하거나, 도구 사용 및 검색과 같은 개별 단계를 테스트할 수 있습니다.
주요 기능은 다음과 같습니다:
- 다양한 즉시 사용 가능한 메트릭:
- 사용자 정의/범용: G-Eval 및 DAG.
- 에이전트 관련: 작업 완료, 도구 정확성, 목표 정확도 및 계획 준수.
- RAG 관련: 답변 관련성, 충실도, 문맥 회상 및 문맥 정밀도.
- 다중 턴: 지식 유지, 대화 완성도 및 역할 준수.
- 멀티모달: 텍스트-이미지 변환, 이미지 편집 및 이미지 일관성.
- 기타: 환각, 요약, 편향성, 독성 및 JSON 정확성.
- 합성 데이터셋 생성: 테스트를 위한 단일 및 다중 턴 데이터셋 생성 기능.
- 벤치마킹: MMLU, HellaSwag, HumanEval과 같은 인기 있는 벤치마크 지원.
- 프롬프트 최적화: 평가 결과를 기반으로 한 자동 프롬프트 최적화.
- 광범위한 통합: LangChain, LangGraph, Pydantic AI, CrewAI, LlamaIndex, OpenAI, Anthropic, Google ADK와 같은 프레임워크와 호환.
이 프레임워크는 NLP 모델을 통한 로컬 실행과 LLM-as-a-judge 패턴을 모두 지원하며, 자동화된 품질 보증을 위해 CI/CD 환경에 통합될 수 있습니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.