프로젝트 소개

Reef는 지속적 자기 개선 에이전트를 위한 최초의 오픈소스 인프라입니다. 에이전트 추론, 피드백, 학습, 버전 관리 전달을 연결합니다. Slime과 SGLang을 사용하여 모델 가중치를 학습하거나, 프롬프트, 규칙, 스킬을 포함한 에이전트의 하네스를 개선할 수 있습니다. ## Reef를 사용해야 하는 경우 에이전트와의 상호작용 방식에서 학습하여 에이전트를 지속적으로 개선하려는 경우 Reef를 사용하세요. 세 가지 학습 경로를 지원합니다: - 모델 가중치 학습: 사용자 맞춤형 강력한 모델을 위해, 학습 가능한 모델, GPU 스택, 피드백이 필요합니다. - 하네스 최적화: 자기 개선 하네스(프롬프트, 규칙, 스킬)를 위해, 모델 엔드포인트, 작업, 평가자가 필요하며 로컬 학습 GPU는 필요 없습니다. - 과학적 발견: 실행 환경, 정확성 검사기, 측정 가능한 목표를 사용한 테스트 시간 학습. ## 작동 방식 Reef는 각 학습 주기를 네 단계로 처리합니다: 1. **서브**: 에이전트 요청을 서비스하고 상호작용을 기록합니다. 2. **관찰**: 기록된 상호작용에 피드백을 매칭합니다. 3. **성장**: 적격 기록에서 업데이트를 생성합니다. 4. **커밋**: 선택 정책을 적용하고 승인된 업데이트를 게시합니다. ## 설치 PyPI에서 `uv pip install reef-infra`로 설치하거나 소스에서 설치합니다. 아티팩트 및 체크포인트 기능에는 `git-lfs`가 필요합니다. ## 사용법 순수 추론 서버로 Reef 시작: `uv run reef serve --inference.model-path Qwen/Qwen2.5-1.5B-Instruct`. 가중치 학습 배포의 경우 SAO 예제를 사용하세요. OpenAI/Anthropic 호환 엔드포인트를 통해 추론 요청을 보내고, 점수와 영수증으로 피드백을 보고하며, 재시작 없이 모델이 학습하고 가중치를 업데이트하는 것을 확인하세요. 하네스 진화 배포의 경우 내장된 Reefine 레시피를 사용하세요. 모델 API를 사용하여 일반 언어 요청에서 코딩 하네스를 개선합니다. `reef-pi`로 하네스를 설치하고 `reef-pi evolve "..."` 같은 명령으로 진화시킵니다. ## 레시피 및 예제 Reef는 과학적 발견(TTT-Discover, Guidance-TTT), 작업 스트림의 지속적 학습(SAO, Meta-Harness, GEPA), 사용에서 학습(OpenClaw-RL, SkillClaw, Reefine)을 위한 레시피를 포함합니다. 각각 가이드, 코드, 예제, 측정된 벤치마크가 있습니다. ## 아키텍처 아키텍처 다이어그램은 하네스 요청이 시나리오를 통해 추론으로 흐르고, 영수증 연결 피드백이 기록 및 레시피 학습에 공급되며, 아티팩트 평가가 버전 관리 게시를 위한 업데이트를 선택하는 것을 보여줍니다. ## 더 알아보기 문서는 빠른 시작, HTTP API, 레시피 작성, 하네스 또는 모델 진화, 레시피 카탈로그, 핵심 루프, 용어집을 다룹니다. ## 커뮤니티 Discord, WeChat, GitHub Discussions에 참여하고, 가이드를 통해 기여하며, RFC를 제안하고, 취약점을 보고하세요. ## 팀 알파벳 순으로 나열: Wenhao Chai, Shuangrui Ding, Shiyi Zoe Du, Hao He, Haoze He, Chonghe Jiang, Nan Jiang, Xuan Jiang, Xiaochen Li, Paul Liang, Bo Liu, Boyuan Long, Qiuyang Mang, Zhenting Qi, Ao Qu, Mingruo Qu, Zhaokai Wang, Xuezhi Yan, Hanfei Yu, Haofei Yu, Simon Yu, Han Zheng, Kaichen Zhou, Zijian Zhou, Jiacheng Zhu, Dingyi Zhuang, Xinkai Zou. ## 감사의 말 Reef의 중요한 부분을 지원하는 SGLang, slime, cordis에 감사드립니다.