Sobre el proyecto

Agent Lightning es un marco de código abierto de Microsoft para entrenar agentes de IA con aprendizaje por refuerzo. Está diseñado en torno a la simplicidad, con aproximadamente 3.500 líneas de código, y permite que los agentes interactúen con modelos a través de un proxy sin requerir cambios en el código existente del agente. El marco mantiene las herramientas, el contexto, el flujo de control y los entornos dentro del bucle de entrenamiento. La arquitectura consta de tres componentes ligeros: un Trainer que ejecuta verl y vLLM, una API Gateway que actúa como proxy de las solicitudes al modelo y captura los datos de entrenamiento, y un Rollout Controller que ejecuta los agentes localmente o como trabajos de Kubernetes. El soporte nativo de Kubernetes permite ejecutar agentes directamente como trabajos sin servicios de sandbox externos. El proyecto incluye un ejemplo completo de entrenamiento de un agente de codificación. Utilizando 6.000 muestras de entrenamiento, un flujo de trabajo integral Qwen3.5-9B mejora el rendimiento en SWE-bench Verified del 41,8% al 56,4%, una ganancia de 14,6 puntos porcentuales. El pipeline publicado incluye limpieza de datos, prevención de recompensas engañosas y scripts de entrenamiento. La documentación cubre la instalación, el inicio rápido, la configuración del entrenador, la configuración de la puerta de enlace de la API, la configuración del controlador y el entrenamiento asíncrono. Los ejemplos incluyen Calc-X, GSM8K, ScienceWorld, Search-R1, LLM-in-Sandbox y un agente de codificación entrenado con pruebas de repositorios. El proyecto se publica bajo la licencia MIT y ha sido evaluado conforme al Estándar de IA Responsable de Microsoft.