这个项目能做什么
iFixAi提供了一套用于对AI智能体进行独立审计的框架,重点聚焦于运营保障和对抗性测试。与传统可观测性工具专注于延迟或token效率等技术指标不同,iFixAi评估的是智能体是否在执行其预期的业务角色。
该工具从五个核心支柱评估智能体:虚构(Fabrication)、操纵(Manipulation)、欺骗(Deception)、不可预测性(Unpredictability)和透明度缺失(Opacity)。基于这些检查,它会给出一个等级评分(A–F)。此外,还提供包含破坏行为(sabotage)和系统性风险等13个额外类别的高级版本,以支持更深层次的深度分析。
主要功能包括:
- 多种执行模式:引导式CLI向导、用于CI/CD自动化的显式CLI参数,以及针对Claude Code、Cursor和VS Code等智能体的原生插件/技能。
- 独立评判:支持"可引用"评分,由第二家独立的AI提供商担任评委,以避免自我评分偏差。
- 灵活集成:可通过OpenAI兼容的HTTP端点测试裸模型API或实际部署的智能体。
- 可定制测试套件:提供多种套件级别,包括冒烟(smoke)、战略(strategic)、核心(core)、扩展(extended)和全部(all)。
- 全面报告:生成JSON和Markdown格式的结果,包含详细的成绩单。
评论
0 评分人数达到10人后显示
登录后参与讨论。