Sobre o projeto

Reef é a primeira infraestrutura de código aberto para agentes contínuos de autoaperfeiçoamento. Ela conecta inferência de agentes, feedback, aprendizado e entrega versionada. Use-a para treinar pesos de modelos com Slime e SGLang, ou melhorar o harness de um agente, incluindo seus prompts, regras e habilidades. ## Quando usar o Reef Use o Reef quando quiser que seu agente continue melhorando simplesmente aprendendo com a forma como você interage com ele. Ele suporta três caminhos de aprendizado: - Treinamento de pesos do modelo: para um modelo mais forte projetado para você, exigindo um modelo treinável, pilha de GPU e feedback. - Otimização de harness: para harness de autoaperfeiçoamento (prompts, regras, habilidades), exigindo um endpoint de modelo, tarefas e avaliador; sem GPUs de treinamento local. - Descobertas científicas: treinamento em tempo de teste com um ambiente de execução, verificador de correção e objetivo mensurável. ## Como funciona O Reef processa cada ciclo de aprendizado em quatro etapas: 1. **Servir**: atender solicitações do agente e registrar interações. 2. **Observar**: combinar feedback com interações registradas. 3. **Crescer**: produzir uma atualização a partir de registros elegíveis. 4. **Confirmar**: aplicar política de seleção e publicar atualizações aceitas. ## Instalação Instale do PyPI com `uv pip install reef-infra` ou a partir do código-fonte. Requer `git-lfs` para funcionalidades de artefatos e checkpoints. ## Uso Inicie o Reef como um servidor de inferência puro: `uv run reef serve --inference.model-path Qwen/Qwen2.5-1.5B-Instruct`. Para implantações de treinamento de pesos, use o exemplo SAO. Envie solicitações de inferência por endpoints compatíveis com OpenAI/Anthropic, reporte feedback com pontuações e recibos, e veja o modelo aprender e atualizar pesos sem reiniciar. Para implantações com evolução de harness, use a receita integrada Reefine. Ela refina um harness de codificação a partir de pedidos em linguagem natural usando uma API de modelo. Instale o harness com `reef-pi` e evolua-o com comandos como `reef-pi evolve "..."`. ## Receitas e exemplos O Reef inclui receitas para descoberta científica (TTT-Discover, Guidance-TTT), aprendizado contínuo em fluxos de tarefas (SAO, Meta-Harness, GEPA) e aprendizado a partir do uso (OpenClaw-RL, SkillClaw, Reefine). Cada uma tem guias, código, exemplos e benchmarks medidos. ## Arquitetura O diagrama de arquitetura mostra solicitações de harness fluindo por um cenário até a inferência, feedback vinculado a recibos alimentando registros e treinamento de receitas, e avaliação de artefatos selecionando atualizações para publicação versionada. ## Saiba mais A documentação cobre início rápido, API HTTP, escrita de receitas, evolução de harness ou modelo, catálogo de receitas, loop principal e glossário. ## Comunidade Participe do Discord, WeChat, GitHub Discussions, contribua via guia, proponha RFCs, reporte vulnerabilidades. ## Equipe Listada em ordem alfabética, incluindo Wenhao Chai, Shuangrui Ding, Shiyi Zoe Du, Hao He, Haoze He, Chonghe Jiang, Nan Jiang, Xuan Jiang, Xiaochen Li, Paul Liang, Bo Liu, Boyuan Long, Qiuyang Mang, Zhenting Qi, Ao Qu, Mingruo Qu, Zhaokai Wang, Xuezhi Yan, Hanfei Yu, Haofei Yu, Simon Yu, Han Zheng, Kaichen Zhou, Zijian Zhou, Jiacheng Zhu, Dingyi Zhuang, Xinkai Zou. ## Agradecimentos Gratos ao SGLang, slime e cordis por impulsionar partes importantes do Reef.