Sobre el proyecto

ART (Agent Reinforcement Trainer) es un framework de aprendizaje por refuerzo de código abierto de OpenPipe que permite que agentes basados en LLM aprendan de la experiencia. Su objetivo declarado es mejorar la fiabilidad de los agentes integrando el entrenamiento GRPO (Optimización de Políticas Relativas por Grupos) en aplicaciones Python ordinarias, para que los agentes de múltiples pasos puedan recibir entrenamiento en el trabajo para tareas del mundo real. Arquitectura ART separa la funcionalidad en un cliente y un servidor. El cliente es compatible con OpenAI y se interconecta con su código existente: usted envía mensajes y recibe completaciones del modelo a medida que mejora. El servidor se ejecuta de forma independiente en una máquina con GPU y abstrae la complejidad de inferencia y entrenamiento, mientras permite configuración. El bucle de entrenamiento documentado funciona de la siguiente manera: 1. Inferencia: su código ejecuta un flujo de trabajo de agente, generalmente varias ejecuciones en paralelo. Las solicitudes de completación se enrutan al servidor ART, que sirve el último LoRA del modelo en vLLM. Cada mensaje de sistema, usuario y asistente se almacena en una Trayectoria, y cuando una ejecución termina, su código asigna una recompensa a esa Trayectoria. 2. Entrenamiento: las Trayectorias terminadas se agrupan y se envían al servidor, y la inferencia se bloquea mientras se ejecuta el entrenamiento. El servidor entrena con GRPO desde el último punto de control (o un LoRA vacío en la primera iteración), guarda el nuevo LoRA localmente, lo carga en vLLM y desbloquea la inferencia. El bucle se repite durante un número configurado de iteraciones. Instalación y uso ART se puede instalar con `pip install openpipe-art` y usarse desde cualquier máquina cliente que ejecute Python. El README apunta a documentación en art.openpipe.ai y a un conjunto de notebooks de Colab que cubren tareas de agente de ejemplo, incluida búsqueda de correo electrónico (ART•E), 2048, integración con LangGraph, dominio de servidor MCP (MCP•RL), Clue Temporal, Tres en Raya, Codenames, AutoRL con RULER y ejemplos de ajuste fino supervisado como destilación y calentamiento SFT seguido de RL. Los notebooks se presentan como introducciones prácticas. Soporte de modelos Se describe que ART funciona con la mayoría de los modelos de lenguaje causales compatibles con vLLM/HuggingFace-transformers, o al menos aquellos compatibles con Unsloth. El README señala que Gemma 3 no parece estar soportado al momento de escribir esto e invita a informar sobre otros modelos no compatibles a través de Discord o problemas de GitHub. La descripción menciona Qwen3.6, GPT-OSS y Llama entre los modelos compatibles. Entrenamiento sin servidor opcional Un servicio gestionado separado, W&B Training (Serverless RL), se presenta como el primer servicio disponible públicamente para entrenar modelos de manera flexible con aprendizaje por refuerzo. Gestiona automáticamente la infraestructura de entrenamiento e inferencia para que los usuarios se centren en datos, entorno y función de recompensa. El README enumera beneficios reclamados, incluido menor costo mediante multiplexación en un clúster de inferencia compartido, entrenamiento más rápido al escalar a muchas solicitudes concurrentes en GPUs, infraestructura totalmente gestionada y despliegue instantáneo de puntos de control mediante W&B Inference. Un breve ejemplo de código muestra el registro de ServerlessBackend y TrainableModel. Integraciones y observabilidad ART promociona integraciones con plataformas alojadas como W&B, Langfuse y OpenPipe para observabilidad y depuración. También destaca la integración con LangGraph para entrenar agentes LangGraph, MCP•RL para enseñar a los modelos a usar herramientas de servidor MCP, AutoRL para entrenamiento sin datos con generación automática de entradas y evaluación RULER, y RULER para generación automática de recompensas. Estado del proyecto y licencia ART está en desarrollo activo y agradece contribuciones a través de su CONTRIBUTING.md. El código fuente está disponible bajo la Licencia Apache-2.0. El README acredita a Unsloth, vLLM, trl y torchtune como proyectos fundamentales e incluye una cita BibTeX.