इस प्रोजेक्ट के बारे में

OpenAI Evals एक ढांचा है जिसे बड़े भाषा मॉडल (LLMs) और उन पर बने सिस्टम का मूल्यांकन करने के लिए डिज़ाइन किया गया है। यह OpenAI मॉडल के विभिन्न आयामों का परीक्षण करने के लिए evals की एक मौजूदा रजिस्ट्री प्रदान करता है, साथ ही विशिष्ट उपयोग मामलों के लिए कस्टम evals लिखने की क्षमता भी देता है। उपयोगकर्ता अपने स्वयं के डेटा का उपयोग करके निजी evals भी बना सकते हैं ताकि सामान्य LLM पैटर्न का प्रतिनिधित्व किया जा सके, बिना डेटा को सार्वजनिक रूप से उजागर किए। सेटअप के लिए OpenAI API कुंजी की आवश्यकता होती है, जिसे OPENAI_API_KEY पर्यावरण चर के माध्यम से निर्दिष्ट किया जाता है। evals रजिस्ट्री Git-LFS का उपयोग करके संग्रहीत की जाती है, और उपयोगकर्ता सभी या चयनित eval डेटा प्राप्त कर सकते हैं। evals बनाने के लिए, रिपो को क्लोन करना और `pip install -e .` के साथ इंस्टॉल करने की सिफारिश की जाती है, जिसमें प्री-कमिट हुक के लिए वैकल्पिक फॉर्मेटर शामिल हैं। Evals चलाना `pip install evals` के माध्यम से किया जा सकता है, जिसके पूर्ण निर्देश run-evals.md और eval-templates.md में हैं। प्रॉम्प्ट चेन या टूल-उपयोग एजेंट जैसे उन्नत उपयोग मामलों को Completion Function Protocol के माध्यम से समर्थित किया जाता है। परिणाम वैकल्पिक रूप से Snowflake डेटाबेस में लॉग किए जा सकते हैं। Evals लिखना build-eval.md, custom-eval.md, और completion-fns.md द्वारा निर्देशित है, जिसमें examples फ़ोल्डर में उदाहरण हैं। वर्तमान में, कस्टम कोड evals स्वीकार नहीं किए जाते हैं, लेकिन कस्टम YAML फ़ाइलों के साथ मॉडल-ग्रेडेड evals का स्वागत है। योगदान की समीक्षा OpenAI कर्मचारियों द्वारा मॉडल सुधार के लिए की जाती है। FAQ सामान्य प्रश्नों को संबोधित करता है, जिसमें शुरू से अंत तक evals बनाने के उदाहरण, कई कार्यान्वयन (जैसे, coqa.yaml), और एक ज्ञात समस्या शामिल है जहां evals अंत में रुक सकते हैं (बाधित करना सुरक्षित है)। गैर-कोडर JSON डेटा और YAML पैरामीटर के साथ मौजूदा eval टेम्पलेट का पालन करके योगदान कर सकते हैं। योगदानकर्ता MIT लाइसेंस के तहत मूल्यांकन तर्क और डेटा साझा करने के लिए सहमत हैं, जिसमें OpenAI सेवा सुधार के लिए डेटा का उपयोग करने का अधिकार सुरक्षित रखता है, उपयोग नीतियों के अधीन।