Sobre el proyecto

AIxploit es un framework automatizado de pruebas de seguridad diseñado para descubrir vulnerabilidades nativas de IA en sistemas agénticos. Es útil para pruebas ofensivas contra un agente de caja gris y para que los desarrolladores de modelos midan y mejoren las salvaguardas contra ataques de inyección reales de extremo a extremo. El framework aborda el peligro de que los agentes de IA reciban herramientas reales (bases de datos, sistemas de archivos, shells, servidores MCP) y actúen sobre datos que no controlan. Automatiza la exploración de superficies de ataque haciendo que los agentes generen inyecciones, luego las dispara contra un objetivo dentro de un sandbox desechable, verificando si el agente fue manipulado. Incluye tres escenarios de ataque: - `ransom`: Un agente de soporte que clasifica tickets es convencido de cifrar correos electrónicos de clientes mediante inyección SQL. - `postgres`: Un agente en una base de datos de solo lectura es presionado para salir del modo de solo lectura y copiar secretos. - `kyc`: Un ataque oculto dentro de una tarea de extracción de pasaportes descarga registros de otros clientes. Cómo funciona: - **Preparar**: Generar un corpus de inyecciones usando `prompt_explorer` (los agentes leen resúmenes de prompts existentes para inventar nuevas técnicas). Configurar contenedores Docker desechables, datos, instrucciones del agente y rutinas personalizadas para sembrar y verificar el éxito. - **Ejecutar**: `aixploit.py` inicia el sandbox, planta la inyección, deja que el agente actúe y recopila las inyecciones exitosas. - **Recopilar exploits**: Los resultados se guardan en `runs/` y los aciertos confirmados en `exploits/`. Inicio rápido: Instalar dependencias, configurar credenciales de API, construir prompts y ejecutar `python aixploit.py --cfg cfg/ransom.yaml`. La generación de prompts está automatizada mediante un agente Claude que lee solo resúmenes de prompts existentes para generar nuevos en cinco dimensiones: marco de autoridad, marco de precondición, presión de cumplimiento, especificación de acción y mimetismo técnico. Los usuarios pueden agregar su propio agente y probarlo proporcionando plantillas, datos, rutinas personalizadas, instrucciones, prompts y un YAML de configuración. Advertencia: Las configuraciones incluidas contienen credenciales codificadas solo para uso interno; no usar en producción.