عن المشروع

OpenAI Evals هو إطار عمل مصمم لتقييم نماذج اللغة الكبيرة (LLMs) والأنظمة المبنية عليها. يوفر سجلاً حاليًا من التقييمات لاختبار أبعاد مختلفة من نماذج OpenAI، بالإضافة إلى إمكانية كتابة تقييمات مخصصة لحالات استخدام محددة. يمكن للمستخدمين أيضًا بناء تقييمات خاصة باستخدام بياناتهم الخاصة لتمثيل أنماط LLM الشائعة دون كشف البيانات علنًا. يتطلب الإعداد مفتاح OpenAI API، يتم تحديده عبر متغير البيئة OPENAI_API_KEY. يتم تخزين سجل التقييمات باستخدام Git-LFS، ويمكن للمستخدمين جلب جميع بيانات التقييم أو تحديدها. لإنشاء التقييمات، يُنصح باستنساخ المستودع وتثبيته باستخدام `pip install -e .`، مع وجود مُنسِّقات اختيارية لخطافات ما قبل الالتزام. يمكن تشغيل التقييمات عبر `pip install evals`، مع تعليمات كاملة في run-evals.md و eval-templates.md. يتم دعم حالات الاستخدام المتقدمة مثل سلاسل المطالبة أو الوكلاء الذين يستخدمون الأدوات من خلال بروتوكول دالة الإكمال. يمكن اختياريًا تسجيل النتائج في قاعدة بيانات Snowflake. تُوجَّه كتابة التقييمات عبر build-eval.md و custom-eval.md و completion-fns.md، مع أمثلة في مجلد الأمثلة. حاليًا، لا يتم قبول تقييمات التعليمات البرمجية المخصصة، ولكن التقييمات المُقيَّمة بواسطة النماذج مع ملفات YAML مخصصة مرحب بها. تتم مراجعة المساهمات من قبل موظفي OpenAI لتحسين النماذج. يتناول قسم الأسئلة الشائعة الأسئلة الشائعة، بما في ذلك أمثلة على بناء التقييمات من البداية إلى النهاية، وتنفيذات متعددة (مثل coqa.yaml)، ومشكلة معروفة حيث قد تتعطل التقييمات في النهاية (من الآمن مقاطعتها). يمكن لغير المبرمجين المساهمة باتباع قوالب التقييم الحالية مع بيانات JSON ومعلمات YAML. يوافق المساهمون على مشاركة منطق التقييم والبيانات بموجب ترخيص MIT، مع احتفاظ OpenAI بحقوق استخدام البيانات لتحسين الخدمات، مع مراعاة سياسات الاستخدام.