bncc-benchmarkbncc-dev
新收录关于巴西国家共同课程基础(BNCC)的LLM幻觉开放基准。衡量模型编造官方代码和文本的程度,具备可审计的方法论、原始数据和CI。
发现优质开源项目,匿名提交开源项目,认领编辑你的开源项目。
带着好奇心,发现开源世界。
THE FIRST COLLECTION关于巴西国家共同课程基础(BNCC)的LLM幻觉开放基准。衡量模型编造官方代码和文本的程度,具备可审计的方法论、原始数据和CI。
这是 Sachin 的 GitHub 个人资料 README,他将自己定义为一名应用 AI 架构师和工程师。该页面展示了涵盖 Agent、检索 (RAG)、评估及可靠性工具的精选开源项目,并列出了其技能、工作风格、合作条款及联系方式。
AgentLeak 是一个面向 AI 代理的开源隐私测试工具。它通过本地 Python SDK、CLI 和 MCP 工具检测工具调用、内存和日志中的数据泄露,提供脱敏报告和 CI 门禁,无需云依赖。
MLflow 是一个开源 AI 工程平台,旨在管理 Agent、LLM 及传统机器学习模型的全生命周期,重点关注可观测性、评估与部署。
SUM 是一个开源工具,用于验证 AI 文本转换并生成加密收据。它检查 AI 改写文本时发生了什么变化、保留了什么、丢失了什么,支持跨运行时 Ed25519 签名和离线验证。
garak 是 NVIDIA 推出的开源 LLM 漏洞扫描器,用于探测生成式 AI 模型的幻觉、数据泄露、提示注入、毒性、越狱等弱点,其定位类似面向 LLM 的 nmap 或 Metasploit。
iFixAi是一款AI智能体的独立审计工具,通过结构化评分系统评估智能体是否遵循业务KPI和组织架构。
DeepEval 是一个开源的 LLM 评估框架,专为 AI 应用(如 RAG、智能体和聊天机器人)提供单元测试支持。