프로젝트 소개

Agent Interlock는 에이전트 간 상호작용에 인터락(interlock)이라는 안전 공학 개념을 적용한 Python 3.11 프레임워크(Apache-2.0)입니다. 액터는 ActorSpec 매니페스트에 선언되며, 각 액터의 표면은 SDK 또는 프록시로 래핑됩니다. 이들 간의 통신은 관찰, 판결 및 차단 과정을 거쳐 선언된 링크만 연결될 수 있도록 제어됩니다. 이 프로젝트는 MCP 도구 게이트웨이를 중심으로 합니다. 도구 포이즈닝, 러그 풀, 도구 섀도잉, 오염된 도구 게시, 혼동된 대리인 또는 토큰 패스스루, MCP 서버-호스트 침해, 에이전트 설정 탐색 및 수정, 자격 증명 수집, 데이터 유출과 같은 M1에서 M9까지의 위협이 데이터 흐름 수준에서 처리되며, 각각 QUARANTINE, BLOCK, HOLD, CHALLENGE 또는 SANITIZE와 같은 기본 판결이 적용됩니다. 강제 적용은 OBSERVE에서 SHADOW를 거쳐 ENFORCE 단계로 승격되며, ENFORCE로의 승격에는 두 개의 서명된 승인이 필요합니다. 29개의 체크 항목으로 구성된 단일 Check 테이블이 세 개의 강제 적용 지점 뒤에 위치하며, 각 지점은 자체 프로필을 선택합니다(MCP 게이트웨이 21개, SDK 19개, A2A 브로커 17개). README에는 메커니즘은 공유되지만 커버리지는 다르며, 브로커에는 이그레스(egress), 볼륨 또는 테인트(taint) 제어가 없다고 명시되어 있습니다. 구성 요소로는 SDK(define_actor, connect, wrap), 액터 간 통신을 가로채는 런타임, A2A, MCP 및 휴먼 트랜스포트를 통해 검증된 작업 DAG를 실행하는 오케스트레이터, 사전 강제 적용을 통해 에이전트 카드와 작업을 처리하는 A2A 브로커, 요청, 판결, 작업 및 결과 이벤트를 별도로 기록하는 추가 전용 원장, 설계/런타임/공격 경로를 위한 그래프 뷰, 아키텍처 편집 및 매니페스트 내보내기를 위한 박스 기반 Studio 웹 UI, Anthropic Tool Runner 어댑터, 그리고 프레임워크의 고정물이 아닌 프로젝트 자체의 보호 도구에 대해 9가지 L1 시나리오를 실행하는 interlock verify 명령이 포함됩니다. 그 외 입증된 영역으로는 아키텍처 다이제스트에 바인딩된 MCP JSON-RPC tools/list, tools/call 및 list-changed 강제 적용; 세션 바인딩이 포함된 Streamable HTTP JSON/SSE 클라이언트; MCP OAuth 탐색, PKCE S256, RFC 7662 인트로스펙션, 선택적 JWKS/JWT 검증 및 루프백 동의; 아티팩트 피닝, 서명된 샌드박스 증명 및 Bubblewrap 실행 계획이 포함된 stdio JSONL 클라이언트; 게시자를 위한 서명된 출처 승인; 아키텍처 매니페스트에서 컴파일된 목적지별 이그레스 가드; PostgreSQL 파티셔닝, session_user 기반 FORCE RLS 및 이벤트/트레이스 HTTP API를 갖춘 추가 전용 원장 어댑터; OTLP/HTTP JSON 인제스트; 서명된 감사 싱크; 멀티 에이전트 엣지에 대한 설계-런타임 드리프트 조정; 방향성 내부/외부 신뢰 경계; 그리고 .invalid 주소를 사용하는 결정론적 고정물을 포함한 가상 데이터 엔드-투-엔드 시나리오 제품군이 있습니다. 참조 코어는 외부 런타임 종속성이 없으며, PostgreSQL 및 Anthropic 통합은 선택적 추가 사항입니다. README에는 제공되지 않는 사항이 솔직하게 기록되어 있습니다. LangGraph 또는 Claude Agent SDK 어댑터, 사이드카 프록시가 없으며, 서버 측 MCP 커넥터 가로채기는 해당 도구가 제공자 측에서 실행되므로 범위에서 제외되었습니다. 수용 평가기는 구조적으로만 작동하며, 매니페스트 파서는 여전히 일부 필드와 부수 효과 작업을 누락합니다. 또한 SDK가 게이트웨이의 승인 API에 도달할 수 없으므로, 래핑된 도구의 외부 쓰기는 SDK에서 승인될 수 있는 대신 폐쇄 실패(fail closed) 처리된다고 기록되어 있습니다. Sigstore, KMS/HSM, ID 제공자, 실제 이그레스 사이드카, TLS 및 분산 속도 제한과 같은 실제 외부 통합 작업은 향후 과제로 남아 있습니다.