このプロジェクトについて

DeepEvalは、大規模言語モデル(LLM)システム向けのオープンソース評価フレームワークであり、Pytestと同様の機能を持ちつつ、AIアプリケーションに特化しています。開発者は、LLMアプリをブラックボックスとしてエンドツーエンドで評価したり、エージェントの全軌跡を分析したり、ツール使用や検索といった個別のステップをテストしたりすることが可能です。 主な機能は以下の通りです: - 多彩な標準メトリクス: - カスタム/汎用:G-Eval、DAG - エージェント関連:タスク完了度、ツール正確性、目標達成度、計画遵守度 - RAG関連:回答の関連性、忠実性、コンテキスト再現率、コンテキスト精度 - マルチターン:知識保持、会話の完全性、役割遵守 - マルチモーダル:テキストから画像への変換、画像編集、画像の一貫性 - その他:ハルシネーション、要約、バイアス、有害性、JSONの正確性 - 合成データセット生成:テスト用のシングルターンおよびマルチターンデータセットを作成可能 - ベンチマーク:MMLU、HellaSwag、HumanEvalなどの主要なベンチマークをサポート - プロンプト最適化:評価結果に基づいた自動プロンプト最適化 - 幅広い統合:LangChain、LangGraph、Pydantic AI、CrewAI、LlamaIndex、OpenAI、Anthropic、Google ADKなどのフレームワークと連携可能 本フレームワークは、NLPモデルによるローカル実行とLLM-as-a-judge(評価者としてのLLM)パターンの両方をサポートしており、CI/CD環境に統合することで自動化された品質保証を実現します。