このプロジェクトについて

AIxploitは、エージェント型システムにおけるAIネイティブな脆弱性を発見するために設計された自動セキュリティテストフレームワークです。グレーボックスエージェントに対する攻撃的テストや、モデル開発者が実際のエンドツーエンドのインジェクション攻撃に対する安全ガードレールを測定・改善するのに役立ちます。 このフレームワークは、AIエージェントに実際のツール(データベース、ファイルシステム、シェル、MCPサーバー)が与えられ、制御できないデータに基づいて行動する危険性に対処します。エージェントがインジェクションをブレインストーミングし、使い捨てサンドボックス内のターゲットに発射して、エージェントが操作されたかどうかを確認することで、攻撃面の探索を自動化します。 3つの攻撃シナリオが付属しています: - `ransom`:チケットをトリアージするサポートエージェントが、SQLインジェクションを介して顧客メールを暗号化するよう誘導されます。 - `postgres`:読み取り専用データベース上のエージェントが、読み取り専用モードを脱出して秘密をコピーするよう促されます。 - `kyc`:パスポート抽出タスクに隠された攻撃が、他の顧客の記録をダンプします。 仕組み: - **準備**:`prompt_explorer`を使用してインジェクションコーパスを生成します(エージェントが既存のプロンプトの要約を読み、新しい手法を考案します)。使い捨てDockerコンテナ、データ、エージェント指示、シードと成功確認のためのカスタムルーチンを設定します。 - **実行**:`aixploit.py`がサンドボックスを起動し、インジェクションを仕込み、エージェントを実行させ、成功したインジェクションを収集します。 - **エクスプロイト収集**:結果は`runs/`に保存され、確認されたヒットは`exploits/`に保存されます。 クイックスタート:依存関係をインストールし、API認証情報を設定し、プロンプトを構築し、`python aixploit.py --cfg cfg/ransom.yaml`を実行します。 プロンプト生成は、既存のプロンプトの要約のみを読み、権威フレーミング、前提条件フレーミング、コンプライアンス圧力、アクション仕様、技術的模倣の5つの次元に沿って新しいプロンプトを生成するClaudeエージェントによって自動化されます。 ユーザーは、テンプレート、データ、カスタムルーチン、指示、プロンプト、設定YAMLを提供することで、独自のエージェントとテストを追加できます。 警告:含まれている設定には内部使用専用のハードコードされた認証情報が含まれています。本番環境では使用しないでください。