这个项目能做什么

Reef 是首个用于持续自我改进智能体的开源基础设施。它连接了智能体推理、反馈、学习和版本化交付。您可以使用 Slime 和 SGLang 训练模型权重,或改进智能体的框架,包括其提示、规则和技能。 ## 何时使用 Reef 当您希望智能体通过从与它的交互中学习来持续改进时,请使用 Reef。它支持三种学习路径: - 模型权重训练:为您打造更强的模型,需要可训练的模型、GPU 堆栈和反馈。 - 框架优化:用于自我改进的框架(提示、规则、技能),需要模型端点、任务和评估器;无需本地训练 GPU。 - 科学发现:在具有执行环境、正确性检查器和可衡量目标的测试时训练。 ## 工作原理 Reef 通过四个步骤处理每个学习周期: 1. **服务**:服务智能体请求并记录交互。 2. **观察**:将反馈与记录的交互匹配。 3. **成长**:从符合条件的记录中生成更新。 4. **提交**:应用选择策略并发布接受的更新。 ## 安装 通过 PyPI 使用 `uv pip install reef-infra` 安装,或从源码安装。需要 `git-lfs` 以支持工件和检查点功能。 ## 使用 将 Reef 作为纯推理服务器启动:`uv run reef serve --inference.model-path Qwen/Qwen2.5-1.5B-Instruct`。 对于权重训练部署,请使用 SAO 示例。通过兼容 OpenAI/Anthropic 的端点发送推理请求,报告带有分数和收据的反馈,并观察模型无需重启即可学习和更新权重。 对于框架演进部署,请使用内置的 Reefine 配方。它使用模型 API 从自然语言请求中优化编码框架。使用 `reef-pi` 安装框架,并使用 `reef-pi evolve "..."` 等命令进行演进。 ## 配方和示例 Reef 包含用于科学发现的配方(TTT-Discover、Guidance-TTT)、任务流持续学习(SAO、Meta-Harness、GEPA)以及从使用中学习(OpenClaw-RL、SkillClaw、Reefine)。每个配方都有指南、代码、示例和实测基准。 ## 架构 架构图展示了框架请求通过场景流向推理,收据关联的反馈馈入记录和配方训练,以及工件评估选择更新以进行版本化发布。 ## 了解更多 文档涵盖快速入门、HTTP API、编写配方、演进框架或模型、配方目录、核心循环和术语表。 ## 社区 加入 Discord、微信、GitHub Discussions,通过指南贡献,提出 RFC,报告漏洞。 ## 团队 按字母顺序列出,包括 Wenhao Chai、Shuangrui Ding、Shiyi Zoe Du、Hao He、Haoze He、Chonghe Jiang、Nan Jiang、Xuan Jiang、Xiaochen Li、Paul Liang、Bo Liu、Boyuan Long、Qiuyang Mang、Zhenting Qi、Ao Qu、Mingruo Qu、Zhaokai Wang、Xuezhi Yan、Hanfei Yu、Haofei Yu、Simon Yu、Han Zheng、Kaichen Zhou、Zijian Zhou、Jiacheng Zhu、Dingyi Zhuang、Xinkai Zou。 ## 致谢 感谢 SGLang、slime 和 cordis 为 Reef 的重要部分提供支持。