À propos du projet

OpenAI Evals est un framework conçu pour évaluer les grands modèles de langage (LLM) et les systèmes qui les utilisent. Il fournit un registre existant d'évaluations pour tester diverses dimensions des modèles OpenAI, ainsi que la possibilité d'écrire des évaluations personnalisées pour des cas d'utilisation spécifiques. Les utilisateurs peuvent également créer des évaluations privées en utilisant leurs propres données pour représenter des schémas courants de LLM sans exposer les données publiquement. La configuration nécessite une clé API OpenAI, spécifiée via la variable d'environnement OPENAI_API_KEY. Le registre d'évaluations est stocké à l'aide de Git-LFS, et les utilisateurs peuvent récupérer toutes les données d'évaluation ou une sélection. Pour créer des évaluations, il est recommandé de cloner le dépôt et d'installer avec `pip install -e .`, avec des formateurs optionnels pour les hooks de pré-commit. L'exécution des évaluations peut se faire via `pip install evals`, avec des instructions complètes dans run-evals.md et eval-templates.md. Les cas d'utilisation avancés comme les chaînes de prompts ou les agents utilisant des outils sont pris en charge via le protocole de fonction de complétion. Les résultats peuvent éventuellement être enregistrés dans une base de données Snowflake. L'écriture d'évaluations est guidée par build-eval.md, custom-eval.md et completion-fns.md, avec des exemples dans le dossier examples. Actuellement, les évaluations de code personnalisées ne sont pas acceptées, mais les évaluations notées par modèle avec des fichiers YAML personnalisés sont les bienvenues. Les contributions sont examinées par le personnel d'OpenAI pour améliorer les modèles. La FAQ répond aux questions courantes, y compris des exemples de construction d'évaluations de bout en bout, plusieurs implémentations (par exemple, coqa.yaml), et un problème connu où les évaluations peuvent se bloquer à la fin (il est sûr d'interrompre). Les non-codeurs peuvent contribuer en suivant les modèles d'évaluation existants avec des données JSON et des paramètres YAML. Les contributeurs acceptent de partager la logique et les données d'évaluation sous licence MIT, OpenAI se réservant le droit d'utiliser les données pour améliorer les services, sous réserve des politiques d'utilisation.