عن المشروع
DeepEval هو إطار عمل مفتوح المصدر لتقييم أنظمة نماذج اللغات الكبيرة (LLM)، يعمل بشكل مشابه لـ Pytest ولكنه متخصص في تطبيقات الذكاء الاصطناعي. يسمح للمطورين بتقييم تطبيقات LLM من البداية إلى النهاية كصناديق سوداء، أو تحليل مسارات الوكلاء الكاملة، أو اختبار خطوات فردية مثل استخدام الأدوات والاسترجاع.
تشمل القدرات الرئيسية ما يلي:
- مجموعة واسعة من المقاييس الجاهزة للاستخدام:
- مخصصة/عامة: G-Eval و DAG.
- الوكلاء: إكمال المهام، صحة الأداة، دقة الهدف، والالتزام بالخطة.
- RAG: صلة الإجابة، الأمانة، الاستدعاء السياقي، والدقة السياقية.
- المحادثات المتعددة: الاحتفاظ بالمعرفة، اكتمال المحادثة، والالتزام بالدور.
- متعدد الوسائط: تحويل النص إلى صورة، تحرير الصور، وتماسك الصور.
- أخرى: الهلوسة، التلخيص، التحيز، السمية، وصحة JSON.
- إنشاء مجموعات بيانات اصطناعية: القدرة على إنشاء مجموعات بيانات أحادية ومتعددة الجولات للاختبار.
- قياس الأداء: دعم المعايير الشهيرة مثل MMLU و HellaSwag و HumanEval.
- تحسين المطالبات: تحسين تلقائي للمطالبات بناءً على نتائج التقييم.
- تكاملات واسعة: يعمل مع أطر عمل مثل LangChain و LangGraph و Pydantic AI و CrewAI و LlamaIndex و OpenAI و Anthropic و Google ADK.
يدعم إطار العمل التنفيذ المحلي عبر نماذج NLP وأنماط "LLM-as-a-judge"، كما يتكامل مع بيئات CI/CD لضمان الجودة المؤتمتة.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.