منصوبے کے بارے میں

AIxploit ایک خودکار سیکیورٹی ٹیسٹنگ فریم ورک ہے جو ایجنٹک سسٹمز میں AI-native کمزوریوں کی نشاندہی کے لیے ڈیزائن کیا گیا ہے۔ یہ گرے باکس ایجنٹ کے خلاف offensive testing کے لیے اور ماڈل ڈویلپرز کے لیے مفید ہے تاکہ حقیقی، end-to-end injection حملوں کے خلاف حفاظتی guardrails کی پیمائش اور بہتری کی جا سکے۔ یہ فریم ورک اس خطرے سے نمٹتا ہے کہ AI ایجنٹس کو حقیقی ٹولز (ڈیٹا بیسز، فائل سسٹمز، shells، MCP سرورز) دیے جاتے ہیں اور وہ ایسے ڈیٹا پر عمل کرتے ہیں جو ان کے کنٹرول میں نہیں۔ یہ حملے کی سطحوں کی کھوج کو خودکار بناتا ہے، ایجنٹس سے injects پر غور و خوض کرواتا ہے، پھر انہیں ایک ڈسپوزایبل سینڈ باکس کے اندر ہدف پر چلاتا ہے، اور جانچتا ہے کہ آیا ایجنٹ کو manipulate کیا گیا۔ اس کے ساتھ تین حملے کے منظرنامے شامل ہیں: - `ransom`: ٹکٹوں کی triage کرنے والے ایک سپورٹ ایجنٹ کو SQL injection کے ذریعے کسٹمر ای میلز encrypt کرنے پر راضی کیا جاتا ہے۔ - `postgres`: read-only ڈیٹا بیس پر موجود ایجنٹ کو read-only موڈ سے نکلنے اور secrets کاپی کرنے پر مجبور کیا جاتا ہے۔ - `kyc`: پاسپورٹ extraction ٹاسک میں چھپا ہوا حملہ دوسرے کسٹمرز کے ریکارڈز کو dump کرتا ہے۔ یہ کیسے کام کرتا ہے: - **Prepare**: `prompt_explorer` استعمال کرتے ہوئے inject corpus تیار کریں (ایجنٹس موجودہ prompts کے summaries پڑھ کر نئی تکنیکیں ایجاد کرتے ہیں)۔ ڈسپوزایبل Docker containers، ڈیٹا، ایجنٹ ہدایات، اور seeding اور کامیابی کی جانچ کے لیے custom routines ترتیب دیں۔ - **Run**: `aixploit.py` سینڈ باکس شروع کرتا ہے، inject لگاتا ہے، ایجنٹ کو چلنے دیتا ہے، اور کامیاب injects جمع کرتا ہے۔ - **Collect exploits**: نتائج `runs/` میں محفوظ ہوتے ہیں اور تصدیق شدہ hits `exploits/` میں۔ Quick start: dependencies انسٹال کریں، API credentials ترتیب دیں، prompts بنائیں، اور `python aixploit.py --cfg cfg/ransom.yaml` چلائیں۔ Prompt generation ایک Claude ایجنٹ کے ذریعے خودکار ہے جو صرف موجودہ prompts کے summaries پڑھتا ہے تاکہ پانچ جہتوں میں نئے prompts بنائے: authority framing، precondition framing، compliance pressure، action specification، اور technical mimicry۔ صارفین اپنا ایجنٹ شامل کر کے templates، ڈیٹا، custom routines، ہدایات، prompts، اور ایک config YAML فراہم کر کے ٹیسٹ کر سکتے ہیں۔ انتباہ: شامل کردہ configurations میں hardcoded credentials صرف اندرونی استعمال کے لیے ہیں؛ production میں استعمال نہ کریں۔