इस प्रोजेक्ट के बारे में

Reef पहला ओपन-सोर्स इंफ्रास्ट्रक्चर है जो निरंतर आत्म-सुधार करने वाले एजेंटों के लिए है। यह एजेंट इंफरेंस, फीडबैक, लर्निंग और संस्करणित डिलीवरी को जोड़ता है। इसका उपयोग Slime और SGLang के साथ मॉडल वेट प्रशिक्षित करने के लिए करें, या एजेंट के हार्नेस को बेहतर बनाने के लिए करें, जिसमें उसके प्रॉम्प्ट्स, नियम और कौशल शामिल हैं। ## Reef का उपयोग कब करें Reef का उपयोग तब करें जब आप चाहते हैं कि आपका एजेंट आपके साथ बातचीत के तरीके से सीखकर लगातार बेहतर होता रहे। यह तीन सीखने के रास्ते समर्थन करता है: - मॉडल वेट प्रशिक्षण: आपके लिए डिज़ाइन किए गए मजबूत मॉडल के लिए, जिसमें प्रशिक्षित करने योग्य मॉडल, GPU स्टैक और फीडबैक की आवश्यकता होती है। - हार्नेस अनुकूलन: आत्म-सुधार हार्नेस (प्रॉम्प्ट्स, नियम, कौशल) के लिए, जिसमें मॉडल एंडपॉइंट, कार्य और मूल्यांकनकर्ता की आवश्यकता होती है; कोई स्थानीय प्रशिक्षण GPU की आवश्यकता नहीं। - वैज्ञानिक खोजें: निष्पादन वातावरण, सहीता जांचकर्ता और मापने योग्य उद्देश्य के साथ परीक्षण-समय प्रशिक्षण। ## यह कैसे काम करता है Reef प्रत्येक सीखने के चक्र को चार चरणों में संसाधित करता है: 1. **सर्व**: एजेंट अनुरोधों को सर्व करें और इंटरैक्शन रिकॉर्ड करें। 2. **ऑब्जर्व**: फीडबैक को रिकॉर्ड किए गए इंटरैक्शन से मिलाएं। 3. **ग्रो**: पात्र रिकॉर्ड से अपडेट उत्पन्न करें। 4. **कमिट**: चयन नीति लागू करें और स्वीकृत अपडेट प्रकाशित करें। ## इंस्टॉलेशन PyPI से `uv pip install reef-infra` के साथ या स्रोत से इंस्टॉल करें। आर्टिफैक्ट और चेकपॉइंट कार्यक्षमता के लिए `git-lfs` आवश्यक है। ## उपयोग Reef को शुद्ध इंफरेंस सर्वर के रूप में शुरू करें: `uv run reef serve --inference.model-path Qwen/Qwen2.5-1.5B-Instruct`। वेट-प्रशिक्षण परिनियोजन के लिए, SAO उदाहरण का उपयोग करें। OpenAI/Anthropic-संगत एंडपॉइंट्स के माध्यम से इंफरेंस अनुरोध भेजें, स्कोर और रसीदों के साथ फीडबैक रिपोर्ट करें, और मॉडल को बिना पुनरारंभ के सीखते और वेट अपडेट करते देखें। हार्नेस-विकास परिनियोजन के लिए, अंतर्निहित Reefine रेसिपी का उपयोग करें। यह मॉडल API का उपयोग करके सादे भाषा के अनुरोधों से कोडिंग हार्नेस को परिष्कृत करता है। हार्नेस को `reef-pi` के साथ इंस्टॉल करें और `reef-pi evolve "..."` जैसे कमांड के साथ विकसित करें। ## रेसिपी और उदाहरण Reef में वैज्ञानिक खोज (TTT-Discover, Guidance-TTT), कार्य स्ट्रीम पर निरंतर सीखना (SAO, Meta-Harness, GEPA), और उपयोग से सीखना (OpenClaw-RL, SkillClaw, Reefine) के लिए रेसिपी शामिल हैं। प्रत्येक में गाइड, कोड, उदाहरण और मापे गए बेंचमार्क हैं। ## आर्किटेक्चर आर्किटेक्चर आरेख दिखाता है कि हार्नेस अनुरोध एक परिदृश्य से इंफरेंस तक प्रवाहित होते हैं, रसीद-लिंक्ड फीडबैक रिकॉर्ड और रेसिपी प्रशिक्षण को फीड करता है, और आर्टिफैक्ट मूल्यांकन संस्करणित प्रकाशन के लिए अपडेट का चयन करता है। ## और जानें दस्तावेज़ीकरण में क्विकस्टार्ट, HTTP API, रेसिपी लिखना, हार्नेस या मॉडल विकसित करना, रेसिपी कैटलॉग, कोर लूप और शब्दावली शामिल है। ## समुदाय Discord, WeChat, GitHub Discussions से जुड़ें, गाइड के माध्यम से योगदान करें, RFC प्रस्तावित करें, भेद्यता रिपोर्ट करें। ## टीम वर्णानुक्रम में सूचीबद्ध, जिसमें Wenhao Chai, Shuangrui Ding, Shiyi Zoe Du, Hao He, Haoze He, Chonghe Jiang, Nan Jiang, Xuan Jiang, Xiaochen Li, Paul Liang, Bo Liu, Boyuan Long, Qiuyang Mang, Zhenting Qi, Ao Qu, Mingruo Qu, Zhaokai Wang, Xuezhi Yan, Hanfei Yu, Haofei Yu, Simon Yu, Han Zheng, Kaichen Zhou, Zijian Zhou, Jiacheng Zhu, Dingyi Zhuang, Xinkai Zou शामिल हैं। ## आभार SGLang, slime और cordis को धन्यवाद जो Reef के महत्वपूर्ण भागों को संचालित करते हैं।