프로젝트 소개
에이전트 무결성 프로토콜(AIP)은 AI 에이전트가 행동을 실행하기 전에 추론(사고 블록)을 평가하도록 설계된 실시간 분석 프레임워크입니다. 이는 LLM 응답에서 사고 내용을 추출하고(Anthropic, OpenAI, Google 및 정규식 폴백 지원), 분석 LLM을 사용하여 정렬 카드(Alignment Card)와 대조 평가하며, 턴 사이 개입을 가능하게 하는 무결성 판정(clear, review_needed, boundary_violation)을 반환합니다. 이 프로토콜에는 공급자 어댑터, 드리프트 감지를 위한 세션 윈도우, 경계 및 공포 값을 평가 기준으로 주입하는 양심 프롬프트 시스템이 포함됩니다. 이는 사후 검증이 아닌 실시간 감지를 제공하는 회고적 에이전트 정렬 프로토콜(AAP)을 보완하는 역할로 자리 잡고 있습니다. 저장소에는 Python 및 TypeScript SDK, 사양, 예제(기본 검사, 게이트웨이 통합, 적대적 시나리오)가 포함되며, ISO/IEC 42001, IEEE 7001 및 EU AI Act와 같은 표준과의 정렬을 주장합니다. 또한 주입을 방지하지 않고, 스트림을 중단하지 않으며, 모델이 사고 블록을 노출하는 것에 의존한다는 한계를 명시적으로 밝힙니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.