প্রকল্প সম্পর্কে
Reef হলো ক্রমাগত স্ব-উন্নয়নশীল এজেন্টদের জন্য প্রথম ওপেন-সোর্স অবকাঠামো। এটি এজেন্ট ইনফারেন্স, ফিডব্যাক, শেখা এবং সংস্করণযুক্ত ডেলিভারি সংযুক্ত করে। এটি ব্যবহার করে Slime এবং SGLang দিয়ে মডেল ওয়েট প্রশিক্ষণ করুন, অথবা এজেন্টের হার্নেস—যার মধ্যে এর প্রম্পট, নিয়ম এবং স্কিল রয়েছে—উন্নত করুন।
## Reef কখন ব্যবহার করবেন
Reef ব্যবহার করুন যখন আপনি চান আপনার এজেন্ট আপনার সাথে যেভাবে ইন্টারঅ্যাক্ট করেন তা থেকে শিখে ক্রমাগত উন্নত হোক। এটি তিনটি শেখার পথ সমর্থন করে:
- মডেল ওয়েট প্রশিক্ষণ: আপনার জন্য ডিজাইন করা একটি শক্তিশালী মডেলের জন্য, যার জন্য একটি প্রশিক্ষণযোগ্য মডেল, GPU স্ট্যাক এবং ফিডব্যাক প্রয়োজন।
- হার্নেস অপ্টিমাইজেশন: স্ব-উন্নয়নশীল হার্নেসের (প্রম্পট, নিয়ম, স্কিল) জন্য, যার জন্য একটি মডেল এন্ডপয়েন্ট, টাস্ক এবং মূল্যায়নকারী প্রয়োজন; স্থানীয় প্রশিক্ষণ GPU লাগে না।
- বৈজ্ঞানিক আবিষ্কার: একটি এক্সিকিউশন এনভায়রনমেন্ট, সঠিকতা যাচাইকারী এবং পরিমাপযোগ্য লক্ষ্য সহ টেস্ট-টাইম প্রশিক্ষণ।
## এটি কীভাবে কাজ করে
Reef প্রতিটি শেখার চক্র চারটি ধাপে প্রক্রিয়া করে:
1. **Serve**: এজেন্ট অনুরোধ পরিবেশন করুন এবং ইন্টারঅ্যাকশন রেকর্ড করুন।
2. **Observe**: রেকর্ড করা ইন্টারঅ্যাকশনের সাথে ফিডব্যাক মেলান।
3. **Grow**: যোগ্য রেকর্ড থেকে একটি আপডেট তৈরি করুন।
4. **Commit**: নির্বাচন নীতি প্রয়োগ করুন এবং গৃহীত আপডেট প্রকাশ করুন।
## ইনস্টলেশন
PyPI থেকে `uv pip install reef-infra` দিয়ে অথবা সোর্স থেকে ইনস্টল করুন। আর্টিফ্যাক্ট এবং চেকপয়েন্ট কার্যকারিতার জন্য `git-lfs` প্রয়োজন।
## ব্যবহার
Reef-কে একটি বিশুদ্ধ ইনফারেন্স সার্ভার হিসেবে চালু করুন: `uv run reef serve --inference.model-path Qwen/Qwen2.5-1.5B-Instruct`।
ওয়েট-প্রশিক্ষণ ডিপ্লয়মেন্টের জন্য SAO উদাহরণ ব্যবহার করুন। OpenAI/Anthropic-সামঞ্জস্যপূর্ণ এন্ডপয়েন্টের মাধ্যমে ইনফারেন্স অনুরোধ পাঠান, স্কোর এবং রসিদসহ ফিডব্যাক রিপোর্ট করুন, এবং মডেল পুনরায় চালু না করেই শিখতে ও ওয়েট আপডেট করতে দেখুন।
হার্নেস-বিবর্তনকারী ডিপ্লয়মেন্টের জন্য বিল্ট-ইন Reefine রেসিপি ব্যবহার করুন। এটি একটি মডেল API ব্যবহার করে সাধারণ ভাষার অনুরোধ থেকে একটি কোডিং হার্নেস পরিমার্জন করে। `reef-pi` দিয়ে হার্নেস ইনস্টল করুন এবং `reef-pi evolve "..."`-এর মতো কমান্ড দিয়ে এটি বিবর্তিত করুন।
## রেসিপি এবং উদাহরণ
Reef-এ বৈজ্ঞানিক আবিষ্কারের (TTT-Discover, Guidance-TTT), টাস্ক স্ট্রিমে ক্রমাগত শেখার (SAO, Meta-Harness, GEPA), এবং ব্যবহার থেকে শেখার (OpenClaw-RL, SkillClaw, Reefine) রেসিপি রয়েছে। প্রতিটির গাইড, কোড, উদাহরণ এবং পরিমাপকৃত বেঞ্চমার্ক রয়েছে।
## আর্কিটেকচার
আর্কিটেকচার ডায়াগ্রাম দেখায় কীভাবে হার্নেস অনুরোধ একটি সিনারিওর মধ্য দিয়ে ইনফারেন্সে প্রবাহিত হয়, রসিদ-সংযুক্ত ফিডব্যাক রেকর্ড এবং রেসিপি প্রশিক্ষণে খাদ্য যোগায়, এবং আর্টিফ্যাক্ট মূল্যায়ন সংস্করণযুক্ত প্রকাশনার জন্য আপডেট নির্বাচন করে।
## আরও জানুন
ডকুমেন্টেশন কভার করে কুইকস্টার্ট, HTTP API, রেসিপি লেখা, হার্নেস বা মডেল বিবর্তন, রেসিপি ক্যাটালগ, কোর লুপ এবং গ্লোসারি।
## কমিউনিটি
Discord, WeChat, GitHub Discussions-এ যোগ দিন, গাইডের মাধ্যমে অবদান রাখুন, RFC প্রস্তাব করুন, দুর্বলতা রিপোর্ট করুন।
## টিম
বর্ণানুক্রমিকভাবে তালিকাভুক্ত, যার মধ্যে রয়েছেন Wenhao Chai, Shuangrui Ding, Shiyi Zoe Du, Hao He, Haoze He, Chonghe Jiang, Nan Jiang, Xuan Jiang, Xiaochen Li, Paul Liang, Bo Liu, Boyuan Long, Qiuyang Mang, Zhenting Qi, Ao Qu, Mingruo Qu, Zhaokai Wang, Xuezhi Yan, Hanfei Yu, Haofei Yu, Simon Yu, Han Zheng, Kaichen Zhou, Zijian Zhou, Jiacheng Zhu, Dingyi Zhuang, Xinkai Zou।
## স্বীকৃতি
Reef-এর গুরুত্বপূর্ণ অংশগুলো চালানোর জন্য SGLang, slime এবং cordis-এর প্রতি কৃতজ্ঞ।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.