Sobre el proyecto
Reef es la primera infraestructura de código abierto para agentes que se automejoran continuamente. Conecta la inferencia del agente, la retroalimentación, el aprendizaje y la entrega versionada. Úsala para entrenar pesos de modelos con Slime y SGLang, o para mejorar el arnés de un agente, incluidos sus prompts, reglas y habilidades.
## Cuándo usar Reef
Usa Reef cuando quieras que tu agente siga mejorando simplemente aprendiendo de cómo interactúas con él. Admite tres rutas de aprendizaje:
- Entrenamiento de pesos del modelo: para un modelo más potente diseñado para ti, que requiere un modelo entrenable, una pila de GPU y retroalimentación.
- Optimización del arnés: para un arnés que se automejora (prompts, reglas, habilidades), que requiere un endpoint de modelo, tareas y un evaluador; sin GPU de entrenamiento locales.
- Descubrimientos científicos: entrenamiento en tiempo de prueba con un entorno de ejecución, un verificador de corrección y un objetivo medible.
## Cómo funciona
Reef procesa cada ciclo de aprendizaje en cuatro pasos:
1. **Servir**: atender las solicitudes del agente y registrar las interacciones.
2. **Observar**: emparejar la retroalimentación con las interacciones registradas.
3. **Crecer**: producir una actualización a partir de los registros elegibles.
4. **Confirmar**: aplicar la política de selección y publicar las actualizaciones aceptadas.
## Instalación
Instala desde PyPI con `uv pip install reef-infra` o desde el código fuente. Requiere `git-lfs` para la funcionalidad de artefactos y checkpoints.
## Uso
Inicia Reef como un servidor de inferencia puro: `uv run reef serve --inference.model-path Qwen/Qwen2.5-1.5B-Instruct`.
Para despliegues con entrenamiento de pesos, usa el ejemplo SAO. Envía solicitudes de inferencia mediante endpoints compatibles con OpenAI/Anthropic, reporta retroalimentación con puntuaciones y recibos, y observa cómo el modelo aprende y actualiza los pesos sin reiniciarse.
Para despliegues con evolución del arnés, usa la receta integrada Reefine. Refina un arnés de programación a partir de peticiones en lenguaje natural usando una API de modelo. Instala el arnés con `reef-pi` y evoluciónalo con comandos como `reef-pi evolve "..."`.
## Recetas y ejemplos
Reef incluye recetas para descubrimiento científico (TTT-Discover, Guidance-TTT), aprendizaje continuo en flujos de tareas (SAO, Meta-Harness, GEPA) y aprendizaje a partir del uso (OpenClaw-RL, SkillClaw, Reefine). Cada una tiene guías, código, ejemplos y benchmarks medidos.
## Arquitectura
El diagrama de arquitectura muestra las solicitudes del arnés fluyendo a través de un escenario hacia la inferencia, la retroalimentación vinculada a recibos alimentando registros y entrenamiento de recetas, y la evaluación de artefactos seleccionando actualizaciones para su publicación versionada.
## Más información
La documentación cubre inicio rápido, API HTTP, escritura de recetas, evolución del arnés o del modelo, catálogo de recetas, bucle central y glosario.
## Comunidad
Únete a Discord, WeChat, GitHub Discussions, contribuye mediante la guía, propón RFC, reporta vulnerabilidades.
## Equipo
Listado alfabéticamente, incluyendo a Wenhao Chai, Shuangrui Ding, Shiyi Zoe Du, Hao He, Haoze He, Chonghe Jiang, Nan Jiang, Xuan Jiang, Xiaochen Li, Paul Liang, Bo Liu, Boyuan Long, Qiuyang Mang, Zhenting Qi, Ao Qu, Mingruo Qu, Zhaokai Wang, Xuezhi Yan, Hanfei Yu, Haofei Yu, Simon Yu, Han Zheng, Kaichen Zhou, Zijian Zhou, Jiacheng Zhu, Dingyi Zhuang, Xinkai Zou.
## Agradecimientos
Agradecemos a SGLang, slime y cordis por impulsar partes importantes de Reef.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.