Об этом проекте
OpenAI Evals — это платформа, предназначенная для оценки больших языковых моделей (LLM) и систем, построенных на их основе. Она предоставляет существующий реестр eval-тестов для проверки различных аспектов моделей OpenAI, а также возможность писать собственные eval-тесты для конкретных случаев использования. Пользователи также могут создавать приватные eval-тесты на основе собственных данных, чтобы отражать типичные сценарии использования LLM, не раскрывая данные публично.
Для настройки требуется ключ OpenAI API, задаваемый через переменную окружения OPENAI_API_KEY. Реестр eval-тестов хранится с использованием Git-LFS, и пользователи могут загружать все или выбранные данные eval-тестов. Для создания eval-тестов рекомендуется клонировать репозиторий и установить его с помощью `pip install -e .`, с опциональными форматтерами для pre-commit хуков.
Запуск eval-тестов можно выполнить через `pip install evals`, полные инструкции приведены в run-evals.md и eval-templates.md. Продвинутые сценарии использования, такие как цепочки промптов или агенты с использованием инструментов, поддерживаются через Completion Function Protocol. Результаты при желании могут записываться в базу данных Snowflake.
Написание eval-тестов описано в build-eval.md, custom-eval.md и completion-fns.md, примеры находятся в папке examples. В настоящее время пользовательские eval-тесты с кодом не принимаются, но приветствуются eval-тесты, оцениваемые моделью, с пользовательскими YAML-файлами. Вклад проверяется сотрудниками OpenAI для улучшения моделей.
В FAQ рассматриваются распространённые вопросы, включая примеры создания eval-тестов от начала до конца, множественные реализации (например, coqa.yaml) и известную проблему, когда eval-тесты могут зависать в конце (безопасно прервать). Непрограммисты могут внести вклад, следуя существующим шаблонам eval-тестов с JSON-данными и YAML-параметрами.
Участники соглашаются предоставлять логику оценки и данные под лицензией MIT, при этом OpenAI сохраняет право использовать данные для улучшения сервиса с учётом политик использования.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.