منصوبے کے بارے میں

OpenAI Evals ایک فریم ورک ہے جو بڑے لینگویج ماڈلز (LLMs) اور ان پر بنائے گئے سسٹمز کی جانچ کے لیے ڈیزائن کیا گیا ہے۔ یہ OpenAI ماڈلز کے مختلف پہلوؤں کو جانچنے کے لیے ایولز کا ایک موجودہ رجسٹری فراہم کرتا ہے، ساتھ ہی مخصوص استعمال کے لیے حسب ضرورت ایولز لکھنے کی صلاحیت بھی دیتا ہے۔ صارفین اپنے ڈیٹا کا استعمال کرتے ہوئے پرائیویٹ ایولز بھی بنا سکتے ہیں تاکہ عام LLM پیٹرنز کو عوامی طور پر ڈیٹا ظاہر کیے بغیر پیش کیا جا سکے۔ سیٹ اپ کے لیے OpenAI API کلید درکار ہے، جو OPENAI_API_KEY ماحولیاتی متغیر کے ذریعے متعین کی جاتی ہے۔ ایولز رجسٹری Git-LFS کے ذریعے محفوظ کی جاتی ہے، اور صارفین تمام یا منتخب ایول ڈیٹا حاصل کر سکتے ہیں۔ ایولز بنانے کے لیے، ریپو کو کلون کرنا اور `pip install -e .` کے ساتھ انسٹال کرنا تجویز کیا جاتا ہے، ساتھ ہی pre-commit ہکس کے لیے اختیاری فارمیٹرز بھی ہیں۔ ایولز چلانا `pip install evals` کے ذریعے کیا جا سکتا ہے، مکمل ہدایات run-evals.md اور eval-templates.md میں موجود ہیں۔ پرامپٹ چینز یا ٹول استعمال کرنے والے ایجنٹس جیسے جدید استعمالات Completion Function Protocol کے ذریعے سپورٹ کیے جاتے ہیں۔ نتائج کو اختیاری طور پر Snowflake ڈیٹا بیس میں لاگ کیا جا سکتا ہے۔ ایولز لکھنے کے لیے build-eval.md، custom-eval.md، اور completion-fns.md رہنمائی فراہم کرتے ہیں، مثالیں examples فولڈر میں دی گئی ہیں۔ فی الحال، حسب ضرورت کوڈ ایولز قبول نہیں کیے جاتے، لیکن حسب ضرورت YAML فائلوں والے ماڈل-گریڈ ایولز خوش آئند ہیں۔ شراکتوں کا جائزہ OpenAI عملہ ماڈل میں بہتری کے لیے کرتا ہے۔ FAQ عام سوالات کا جواب دیتا ہے، بشمول شروع سے آخر تک ایولز بنانے کی مثالیں، متعدد نفاذات (مثلاً coqa.yaml)، اور ایک معروف مسئلہ جہاں ایولز آخر میں رک سکتے ہیں (روکنا محفوظ ہے)۔ غیر کوڈرز موجودہ ایول ٹیمپلیٹس کی پیروی کرتے ہوئے JSON ڈیٹا اور YAML پیرامیٹرز کے ساتھ تعاون کر سکتے ہیں۔ شراکت دار MIT لائسنس کے تحت تشخیصی منطق اور ڈیٹا شیئر کرنے سے اتفاق کرتے ہیں، جبکہ OpenAI استعمال کی پالیسیوں کے تحت خدمت میں بہتری کے لیے ڈیٹا استعمال کرنے کا حق محفوظ رکھتا ہے۔