프로젝트 소개

OpenAI Evals는 대규모 언어 모델(LLM) 및 이를 기반으로 구축된 시스템을 평가하기 위해 설계된 프레임워크입니다. OpenAI 모델의 다양한 측면을 테스트하기 위한 기존 평가 레지스트리를 제공하며, 특정 사용 사례에 맞춘 맞춤형 평가를 작성할 수 있는 기능도 포함합니다. 사용자는 공개적으로 데이터를 노출하지 않고 일반적인 LLM 패턴을 나타내기 위해 자체 데이터를 사용하여 비공개 평가를 구축할 수도 있습니다. 설정에는 OPENAI_API_KEY 환경 변수를 통해 지정된 OpenAI API 키가 필요합니다. 평가 레지스트리는 Git-LFS를 사용하여 저장되며, 사용자는 모든 평가 데이터 또는 선택된 평가 데이터를 가져올 수 있습니다. 평가를 생성하려면 저장소를 클론하고 `pip install -e .`로 설치하는 것이 권장되며, 사전 커밋 훅을 위한 선택적 포맷터도 제공됩니다. 평가 실행은 `pip install evals`를 통해 수행할 수 있으며, 전체 지침은 run-evals.md 및 eval-templates.md에 있습니다. 프롬프트 체인이나 도구 사용 에이전트와 같은 고급 사용 사례는 Completion Function Protocol을 통해 지원됩니다. 결과는 선택적으로 Snowflake 데이터베이스에 기록할 수 있습니다. 평가 작성은 build-eval.md, custom-eval.md 및 completion-fns.md에 따라 안내되며, examples 폴더에 예제가 있습니다. 현재 맞춤형 코드 평가는 허용되지 않지만, 맞춤형 YAML 파일을 사용한 모델 기반 평가는 환영합니다. 기여는 모델 개선을 위해 OpenAI 직원이 검토합니다. FAQ는 일반적인 질문을 다루며, 처음부터 끝까지 평가 구축 예제, 여러 구현(예: coqa.yaml), 및 평가가 끝에서 멈출 수 있는 알려진 문제(중단해도 안전함)를 포함합니다. 비코더는 JSON 데이터와 YAML 매개변수를 사용하여 기존 평가 템플릿을 따르는 방식으로 기여할 수 있습니다. 기여자는 MIT 라이선스에 따라 평가 로직과 데이터를 공유하는 데 동의하며, OpenAI는 서비스 개선을 위해 데이터를 사용할 권리를 보유하되 사용 정책의 적용을 받습니다.