这个项目能做什么
OpenAI Evals是一个专为评估大型语言模型(LLM)及其构建的系统而设计的框架。它提供了一个现有的评估注册表,用于测试OpenAI模型的多个维度,同时支持为特定用例编写自定义评估。用户还可以使用自己的数据构建私有评估,以代表常见的LLM模式,而无需公开数据。
设置需要OpenAI API密钥,通过OPENAI_API_KEY环境变量指定。评估注册表使用Git-LFS存储,用户可以获取全部或部分评估数据。对于创建评估,建议克隆仓库并使用`pip install -e .`进行安装,可选配用于预提交钩子的格式化工具。
运行评估可通过`pip install evals`完成,详细说明见run-evals.md和eval-templates.md。高级用例,如提示链或工具使用代理,通过Completion Function Protocol得到支持。结果可选地记录到Snowflake数据库。
编写评估的指南见build-eval.md、custom-eval.md和completion-fns.md,示例位于examples文件夹中。目前,不接受自定义代码评估,但欢迎带有自定义YAML文件的模型评分评估。贡献由OpenAI员工审查,以改进模型。
FAQ解答了常见问题,包括从头构建评估的示例、多种实现(如coqa.yaml),以及一个已知问题:评估可能在结束时挂起(可安全中断)。非编码人员可以通过遵循现有的评估模板,使用JSON数据和YAML参数进行贡献。
贡献者同意根据MIT许可证共享评估逻辑和数据,OpenAI保留使用数据改进服务的权利,但需遵守使用政策。
评论
0 评分人数达到10人后显示
登录后参与讨论。