منصوبے کے بارے میں
Reef مسلسل خود کو بہتر بنانے والے ایجنٹس کے لیے پہلا اوپن سورس انفراسٹرکچر ہے۔ یہ ایجنٹ انفرنس، فیڈبیک، لرننگ اور ورژنڈ ڈیلیوری کو جوڑتا ہے۔ اسے Slime اور SGLang کے ساتھ ماڈل ویٹس کی تربیت کے لیے استعمال کریں، یا ایجنٹ کے ہارنس کو بہتر بنائیں، بشمول اس کے پرامپٹس، قواعد اور مہارتیں۔
## Reef کب استعمال کریں
Reef اس وقت استعمال کریں جب آپ چاہتے ہیں کہ آپ کا ایجنٹ صرف آپ کے ایجنٹ کے ساتھ تعامل کے طریقے سے سیکھ کر بہتر ہوتا رہے۔ یہ تین لرننگ پاتھ سپورٹ کرتا ہے:
- ماڈل ویٹ ٹریننگ: آپ کے لیے ڈیزائن کردہ مضبوط ماڈل کے لیے، جس کے لیے ٹرین ایبل ماڈل، GPU اسٹیک اور فیڈبیک درکار ہے۔
- ہارنس آپٹیمائزیشن: خود کو بہتر بنانے والے ہارنس (پرامپٹس، قواعد، مہارتیں) کے لیے، جس کے لیے ماڈل اینڈپوائنٹ، ٹاسکس اور ایویلیوایٹر درکار ہے؛ مقامی ٹریننگ GPUs کی ضرورت نہیں۔
- سائنسی دریافتیں: ایگزیکیوشن ماحول، درستگی چیکر اور قابل پیمائش مقصد کے ساتھ ٹیسٹ ٹائم ٹریننگ۔
## یہ کیسے کام کرتا ہے
Reef ہر لرننگ سائیکل کو چار مراحل میں پروسیس کرتا ہے:
1. **Serve**: ایجنٹ کی درخواستیں پیش کریں اور تعاملات ریکارڈ کریں۔
2. **Observe**: فیڈبیک کو ریکارڈ شدہ تعاملات سے میچ کریں۔
3. **Grow**: اہل ریکارڈز سے اپ ڈیٹ تیار کریں۔
4. **Commit**: سلیکشن پالیسی لاگو کریں اور قبول شدہ اپ ڈیٹس شائع کریں۔
## انسٹالیشن
PyPI سے `uv pip install reef-infra` کے ساتھ یا سورس سے انسٹال کریں۔ آرٹیفیکٹ اور چیک پوائنٹ فعالیت کے لیے `git-lfs` درکار ہے۔
## استعمال
Reef کو خالص انفرنس سرور کے طور پر شروع کریں: `uv run reef serve --inference.model-path Qwen/Qwen2.5-1.5B-Instruct`۔
ویٹ ٹریننگ ڈیپلائمنٹس کے لیے، SAO مثال استعمال کریں۔ OpenAI/Anthropic کے موافق اینڈپوائنٹس کے ذریعے انفرنس درخواستیں بھیجیں، اسکورز اور رسیدوں کے ساتھ فیڈبیک رپورٹ کریں، اور ماڈل کو بغیر ری اسٹارٹ کے سیکھتے اور ویٹس اپ ڈیٹ کرتے دیکھیں۔
ہارنس کو ارتقا دینے والی ڈیپلائمنٹس کے لیے، بلٹ ان Reefine ریسیپی استعمال کریں۔ یہ ماڈل API استعمال کرتے ہوئے سادہ زبان کی درخواستوں سے کوڈنگ ہارنس کو بہتر بناتی ہے۔ ہارنس کو `reef-pi` کے ساتھ انسٹال کریں اور اسے `reef-pi evolve "..."` جیسے کمانڈز سے ارتقا دیں۔
## ریسیپیز اور مثالیں
Reef میں سائنسی دریافت (TTT-Discover، Guidance-TTT)، ٹاسک اسٹریمز پر مسلسل لرننگ (SAO، Meta-Harness، GEPA)، اور استعمال سے سیکھنے (OpenClaw-RL، SkillClaw، Reefine) کے لیے ریسیپیز شامل ہیں۔ ہر ایک کے گائیڈز، کوڈ، مثالیں اور ماپے گئے بینچ مارکس موجود ہیں۔
## آرکیٹیکچر
آرکیٹیکچر ڈایاگرام دکھاتا ہے کہ ہارنس درخواستیں ایک منظر نامے کے ذریعے انفرنس تک بہتی ہیں، رسید سے منسلک فیڈبیک ریکارڈز اور ریسیپی ٹریننگ کو فیڈ کرتا ہے، اور آرٹیفیکٹ ایویلیوایشن ورژنڈ پبلیکیشن کے لیے اپ ڈیٹس منتخب کرتی ہے۔
## مزید جانیں
دستاویزات میں کوئیک اسٹارٹ، HTTP API، ریسیپیز لکھنا، ہارنس یا ماڈل کا ارتقا، ریسیپی کیٹلاگ، کور لوپ اور گلوسری شامل ہیں۔
## کمیونٹی
Discord، WeChat، GitHub Discussions میں شامل ہوں، گائیڈ کے ذریعے تعاون کریں، RFCs تجویز کریں، کمزوریوں کی اطلاع دیں۔
## ٹیم
حروف تہجی کے مطابق درج، بشمول Wenhao Chai، Shuangrui Ding، Shiyi Zoe Du، Hao He، Haoze He، Chonghe Jiang، Nan Jiang، Xuan Jiang، Xiaochen Li، Paul Liang، Bo Liu، Boyuan Long، Qiuyang Mang، Zhenting Qi، Ao Qu، Mingruo Qu، Zhaokai Wang، Xuezhi Yan، Hanfei Yu، Haofei Yu، Simon Yu، Han Zheng، Kaichen Zhou، Zijian Zhou، Jiacheng Zhu، Dingyi Zhuang، Xinkai Zou۔
## اعترافات
SGLang، slime اور cordis کے Reef کے اہم حصوں کو طاقت دینے پر شکر گزار ہیں۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.