منصوبے کے بارے میں
DeepEval لارج لینگویج ماڈل (LLM) سسٹمز کے لیے ایک اوپن سورس ایویلیوایشن فریم ورک ہے، جو Pytest کی طرح کام کرتا ہے لیکن خاص طور پر AI ایپلی کیشنز کے لیے بنایا گیا ہے۔ یہ ڈویلپرز کو LLM ایپس کو اینڈ-ٹو-اینڈ بلیک باکس کے طور پر جانچنے، مکمل ایجنٹ ٹریجیکٹریز کا تجزیہ کرنے، یا ٹول کے استعمال اور ریٹریول جیسے انفرادی مراحل کی جانچ کرنے کی سہولت دیتا ہے۔
اہم خصوصیات میں شامل ہیں:
- استعمال کے لیے تیار میٹرکس کی وسیع رینج:
- کسٹم/آل پرپز: G-Eval اور DAG۔
- ایجنٹک: ٹاسک کمپلیشن، ٹول کریکٹنس، گول ایکوریسی، اور پلان ایڈہیرنس۔
- RAG: انسر ریلیونسی، فیتھ فلنس، کانٹیکسٹول ریکال، اور کانٹیکسٹول پریسیشن۔
- ملٹی ٹرن: نالج ریٹینشن، کنورسیشن کمپلیٹنس، اور رول ایڈہیرنس۔
- ملٹی ماڈل: ٹیکسٹ ٹو امیج، امیج ایڈیٹنگ، اور امیج کوہرنس۔
- دیگر: ہیلوسینیشن، سمرائزیشن، بائس، ٹاکسیسٹی، اور JSON کریکٹنس۔
- سنتھیٹک ڈیٹا سیٹ جنریشن: ٹیسٹنگ کے لیے سنگل اور ملٹی ٹرن ڈیٹا سیٹس بنانے کی صلاحیت۔
- بینچ مارکنگ: MMLU، HellaSwag، اور HumanEval جیسے مقبول بینچ مارکس کے لیے سپورٹ۔
- پرامپٹ آپٹیمائزیشن: ایویلیوایشن کے نتائج کی بنیاد پر خودکار پرامپٹ آپٹیمائزیشن۔
- وسیع انٹیگریشنز: LangChain، LangGraph، Pydantic AI، CrewAI، LlamaIndex، OpenAI، Anthropic، اور Google ADK جیسے فریم ورکس کے ساتھ کام کرتا ہے۔
یہ فریم ورک NLP ماڈلز کے ذریعے مقامی ایگزیکیوشن اور LLM-as-a-judge پیٹرنز دونوں کو سپورٹ کرتا ہے، اور خودکار کوالٹی ایشورنس کے لیے CI/CD ماحول میں ضم ہو جاتا ہے۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.