这个项目能做什么
Reef 是首个用于持续自我改进智能体的开源基础设施。它连接了智能体推理、反馈、学习和版本化交付。您可以使用 Slime 和 SGLang 训练模型权重,或改进智能体的框架,包括其提示、规则和技能。
## 何时使用 Reef
当您希望智能体通过从与它的交互中学习来持续改进时,请使用 Reef。它支持三种学习路径:
- 模型权重训练:为您打造更强的模型,需要可训练的模型、GPU 堆栈和反馈。
- 框架优化:用于自我改进的框架(提示、规则、技能),需要模型端点、任务和评估器;无需本地训练 GPU。
- 科学发现:在具有执行环境、正确性检查器和可衡量目标的测试时训练。
## 工作原理
Reef 通过四个步骤处理每个学习周期:
1. **服务**:服务智能体请求并记录交互。
2. **观察**:将反馈与记录的交互匹配。
3. **成长**:从符合条件的记录中生成更新。
4. **提交**:应用选择策略并发布接受的更新。
## 安装
通过 PyPI 使用 `uv pip install reef-infra` 安装,或从源码安装。需要 `git-lfs` 以支持工件和检查点功能。
## 使用
将 Reef 作为纯推理服务器启动:`uv run reef serve --inference.model-path Qwen/Qwen2.5-1.5B-Instruct`。
对于权重训练部署,请使用 SAO 示例。通过兼容 OpenAI/Anthropic 的端点发送推理请求,报告带有分数和收据的反馈,并观察模型无需重启即可学习和更新权重。
对于框架演进部署,请使用内置的 Reefine 配方。它使用模型 API 从自然语言请求中优化编码框架。使用 `reef-pi` 安装框架,并使用 `reef-pi evolve "..."` 等命令进行演进。
## 配方和示例
Reef 包含用于科学发现的配方(TTT-Discover、Guidance-TTT)、任务流持续学习(SAO、Meta-Harness、GEPA)以及从使用中学习(OpenClaw-RL、SkillClaw、Reefine)。每个配方都有指南、代码、示例和实测基准。
## 架构
架构图展示了框架请求通过场景流向推理,收据关联的反馈馈入记录和配方训练,以及工件评估选择更新以进行版本化发布。
## 了解更多
文档涵盖快速入门、HTTP API、编写配方、演进框架或模型、配方目录、核心循环和术语表。
## 社区
加入 Discord、微信、GitHub Discussions,通过指南贡献,提出 RFC,报告漏洞。
## 团队
按字母顺序列出,包括 Wenhao Chai、Shuangrui Ding、Shiyi Zoe Du、Hao He、Haoze He、Chonghe Jiang、Nan Jiang、Xuan Jiang、Xiaochen Li、Paul Liang、Bo Liu、Boyuan Long、Qiuyang Mang、Zhenting Qi、Ao Qu、Mingruo Qu、Zhaokai Wang、Xuezhi Yan、Hanfei Yu、Haofei Yu、Simon Yu、Han Zheng、Kaichen Zhou、Zijian Zhou、Jiacheng Zhu、Dingyi Zhuang、Xinkai Zou。
## 致谢
感谢 SGLang、slime 和 cordis 为 Reef 的重要部分提供支持。
评论
0 评分人数达到10人后显示
登录后参与讨论。