Sobre el proyecto

Reef es la primera infraestructura de código abierto para agentes que se automejoran continuamente. Conecta la inferencia del agente, la retroalimentación, el aprendizaje y la entrega versionada. Úsala para entrenar pesos de modelos con Slime y SGLang, o para mejorar el arnés de un agente, incluidos sus prompts, reglas y habilidades. ## Cuándo usar Reef Usa Reef cuando quieras que tu agente siga mejorando simplemente aprendiendo de cómo interactúas con él. Admite tres rutas de aprendizaje: - Entrenamiento de pesos del modelo: para un modelo más potente diseñado para ti, que requiere un modelo entrenable, una pila de GPU y retroalimentación. - Optimización del arnés: para un arnés que se automejora (prompts, reglas, habilidades), que requiere un endpoint de modelo, tareas y un evaluador; sin GPU de entrenamiento locales. - Descubrimientos científicos: entrenamiento en tiempo de prueba con un entorno de ejecución, un verificador de corrección y un objetivo medible. ## Cómo funciona Reef procesa cada ciclo de aprendizaje en cuatro pasos: 1. **Servir**: atender las solicitudes del agente y registrar las interacciones. 2. **Observar**: emparejar la retroalimentación con las interacciones registradas. 3. **Crecer**: producir una actualización a partir de los registros elegibles. 4. **Confirmar**: aplicar la política de selección y publicar las actualizaciones aceptadas. ## Instalación Instala desde PyPI con `uv pip install reef-infra` o desde el código fuente. Requiere `git-lfs` para la funcionalidad de artefactos y checkpoints. ## Uso Inicia Reef como un servidor de inferencia puro: `uv run reef serve --inference.model-path Qwen/Qwen2.5-1.5B-Instruct`. Para despliegues con entrenamiento de pesos, usa el ejemplo SAO. Envía solicitudes de inferencia mediante endpoints compatibles con OpenAI/Anthropic, reporta retroalimentación con puntuaciones y recibos, y observa cómo el modelo aprende y actualiza los pesos sin reiniciarse. Para despliegues con evolución del arnés, usa la receta integrada Reefine. Refina un arnés de programación a partir de peticiones en lenguaje natural usando una API de modelo. Instala el arnés con `reef-pi` y evoluciónalo con comandos como `reef-pi evolve "..."`. ## Recetas y ejemplos Reef incluye recetas para descubrimiento científico (TTT-Discover, Guidance-TTT), aprendizaje continuo en flujos de tareas (SAO, Meta-Harness, GEPA) y aprendizaje a partir del uso (OpenClaw-RL, SkillClaw, Reefine). Cada una tiene guías, código, ejemplos y benchmarks medidos. ## Arquitectura El diagrama de arquitectura muestra las solicitudes del arnés fluyendo a través de un escenario hacia la inferencia, la retroalimentación vinculada a recibos alimentando registros y entrenamiento de recetas, y la evaluación de artefactos seleccionando actualizaciones para su publicación versionada. ## Más información La documentación cubre inicio rápido, API HTTP, escritura de recetas, evolución del arnés o del modelo, catálogo de recetas, bucle central y glosario. ## Comunidad Únete a Discord, WeChat, GitHub Discussions, contribuye mediante la guía, propón RFC, reporta vulnerabilidades. ## Equipo Listado alfabéticamente, incluyendo a Wenhao Chai, Shuangrui Ding, Shiyi Zoe Du, Hao He, Haoze He, Chonghe Jiang, Nan Jiang, Xuan Jiang, Xiaochen Li, Paul Liang, Bo Liu, Boyuan Long, Qiuyang Mang, Zhenting Qi, Ao Qu, Mingruo Qu, Zhaokai Wang, Xuezhi Yan, Hanfei Yu, Haofei Yu, Simon Yu, Han Zheng, Kaichen Zhou, Zijian Zhou, Jiacheng Zhu, Dingyi Zhuang, Xinkai Zou. ## Agradecimientos Agradecemos a SGLang, slime y cordis por impulsar partes importantes de Reef.