Sobre o projeto

ART (Agent Reinforcement Trainer) é um framework de aprendizado por reforço open-source da OpenPipe que permite que agentes baseados em LLM aprendam com a experiência. Seu objetivo declarado é melhorar a confiabilidade dos agentes integrando o treinamento GRPO (Group Relative Policy Optimization) em aplicações Python comuns, para que agentes multi-etapa possam receber treinamento em serviço para tarefas do mundo real. Arquitetura O ART separa a funcionalidade em um cliente e um servidor. O cliente é compatível com OpenAI e faz interface com seu código existente: você envia mensagens e recebe respostas do modelo conforme ele melhora. O servidor roda independentemente em uma máquina com GPU e abstrai a complexidade de inferência e treinamento, permitindo configuração. O loop de treinamento documentado funciona da seguinte forma: 1. Inferência: seu código executa um fluxo de trabalho agêntico, geralmente várias execuções em paralelo. As solicitações de conclusão são roteadas para o servidor ART, que serve o LoRA mais recente do modelo no vLLM. Cada mensagem de sistema, usuário e assistente é armazenada em uma Trajetória, e quando uma execução termina, seu código atribui uma recompensa a essa Trajetória. 2. Treinamento: as Trajetórias concluídas são agrupadas e enviadas ao servidor, e a inferência é bloqueada enquanto o treinamento é executado. O servidor treina com GRPO a partir do checkpoint mais recente (ou um LoRA vazio na primeira iteração), salva o novo LoRA localmente, carrega-o no vLLM e desbloqueia a inferência. O loop se repete por um número configurado de iterações. Instalação e uso O ART pode ser instalado com `pip install openpipe-art` e usado a partir de qualquer máquina cliente com Python. O README aponta para a documentação em art.openpipe.ai e para um conjunto de notebooks Colab cobrindo tarefas de exemplo de agentes, incluindo busca de e-mail (ART•E), 2048, integração LangGraph, domínio de servidor MCP (MCP•RL), Temporal Clue, Tic Tac Toe, Codenames, AutoRL com RULER e exemplos de ajuste fino supervisionado, como destilação e aquecimento SFT seguido de RL. Os notebooks são apresentados como introduções práticas. Suporte a modelos O ART é descrito como funcionando com a maioria dos modelos de linguagem causal compatíveis com vLLM/HuggingFace-transformers, ou pelo menos aqueles suportados pelo Unsloth. O README observa que o Gemma 3 não parece ser suportado no momento da escrita e convida a relatar outros modelos não suportados via Discord ou issues no GitHub. A descrição menciona Qwen3.6, GPT-OSS e Llama entre os modelos suportados. Treinamento serverless opcional Um serviço gerenciado separado, W&B Training (Serverless RL), é apresentado como o primeiro serviço disponível publicamente para treinar modelos com aprendizado por reforço de forma flexível. Ele gerencia a infraestrutura de treinamento e inferência automaticamente para que os usuários se concentrem em dados, ambiente e função de recompensa. O README lista benefícios reivindicados, incluindo menor custo por multiplexação em um cluster de inferência compartilhado, treinamento mais rápido ao escalar para muitas solicitações concorrentes em GPUs, infraestrutura totalmente gerenciada e implantação instantânea de checkpoints via W&B Inference. Um pequeno exemplo de código mostra o registro de um ServerlessBackend e TrainableModel. Integrações e observabilidade O ART anuncia integrações com plataformas hospedadas como W&B, Langfuse e OpenPipe para observabilidade e depuração. Também destaca a integração LangGraph para treinar agentes LangGraph, MCP•RL para ensinar modelos a usar ferramentas de servidor MCP, AutoRL para treinamento sem dados com geração automática de entrada e avaliação RULER, e RULER para geração automática de recompensas. Status do projeto e licenciamento O ART está em desenvolvimento ativo e aceita contribuições via CONTRIBUTING.md. O código-fonte está disponível sob a Licença Apache-2.0. O README credita Unsloth, vLLM, trl e torchtune como projetos fundamentais e inclui uma citação BibTeX.