À propos du projet
Le protocole d'intégrité des agents (AIP) est un cadre d'analyse en temps réel conçu pour évaluer le raisonnement (blocs de réflexion) des agents IA avant qu'ils n'exécutent des actions. Il extrait le contenu de réflexion des réponses LLM (prenant en charge Anthropic, OpenAI, Google et un repli basé sur des expressions régulières), l'évalue par rapport à une carte d'alignement à l'aide d'un LLM d'analyse, et renvoie des verdicts d'intégrité (clair, révision_nécessaire, violation_de_limite) pour permettre une intervention entre les tours. Le protocole comprend des adaptateurs de fournisseurs, un fenêtrage de session pour la détection de dérive, et un système de prompt de conscience qui injecte des valeurs de limites et de peur comme critères d'évaluation. Il est positionné comme un complément au protocole d'alignement des agents (AAP) rétroactif, offrant une détection en temps réel plutôt qu'une vérification a posteriori. Le dépôt comprend des SDK Python et TypeScript, une spécification, des exemples (vérifications de base, intégration de passerelle, scénarios adverses), et revendique une conformité avec des normes telles que ISO/IEC 42001, IEEE 7001 et l'AI Act de l'UE. Il indique explicitement ses limites : il ne prévient pas l'injection, n'interrompt pas les flux, et repose sur des modèles exposant des blocs de réflexion.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.