Об этом проекте
ART (Agent Reinforcement Trainer) — это фреймворк обучения с подкреплением с открытым исходным кодом от OpenPipe, который позволяет агентам на основе LLM учиться на опыте. Заявленная цель — повысить надежность агентов путем интеграции обучения GRPO (Group Relative Policy Optimization) в обычные Python-приложения, чтобы многошаговые агенты могли проходить обучение на реальных задачах.
Архитектура
ART разделяет функциональность на клиент и сервер. Клиент совместим с OpenAI и взаимодействует с вашим существующим кодом: вы передаете сообщения и получаете ответы от модели по мере ее улучшения. Сервер работает независимо на машине с GPU и абстрагирует сложность инференса и обучения, сохраняя возможность настройки.
Документированный цикл обучения выглядит следующим образом:
1. Инференс: ваш код запускает агентский рабочий процесс, обычно несколько прогонов параллельно. Запросы на завершение направляются на сервер ART, который обслуживает последнюю LoRA модели в vLLM. Каждое системное, пользовательское и ассистентское сообщение сохраняется в Trajectory, и когда прогон завершается, ваш код присваивает вознаграждение этой Trajectory.
2. Обучение: завершенные Trajectory группируются и отправляются на сервер, а инференс блокируется во время обучения. Сервер обучает с помощью GRPO, начиная с последней контрольной точки (или пустой LoRA на первой итерации), сохраняет новую LoRA локально, загружает ее в vLLM и разблокирует инференс. Цикл повторяется заданное количество итераций.
Установка и использование
ART можно установить с помощью `pip install openpipe-art` и использовать с любого клиентского компьютера с Python. README ссылается на документацию на art.openpipe.ai и на набор блокнотов Colab, охватывающих примеры агентских задач, включая поиск электронной почты (ART•E), 2048, интеграцию LangGraph, освоение MCP-серверов (MCP•RL), Temporal Clue, Tic Tac Toe, Codenames, AutoRL с RULER и примеры обучения с учителем, такие как дистилляция и разогрев SFT с последующим RL. Блокноты представлены как практические введения.
Поддержка моделей
ART описан как работающий с большинством совместимых с vLLM/HuggingFace-transformers причинных языковых моделей, или по крайней мере с теми, которые поддерживаются Unsloth. В README отмечается, что Gemma 3, по-видимому, не поддерживается на момент написания, и предлагается сообщать о других неподдерживаемых моделях через Discord или GitHub issues. В описании упоминаются Qwen3.6, GPT-OSS и Llama среди поддерживаемых моделей.
Опциональное серверное обучение
Отдельный управляемый сервис, W&B Training (Serverless RL), представлен как первый публично доступный сервис для гибкого обучения моделей с помощью обучения с подкреплением. Он автоматически управляет инфраструктурой обучения и инференса, чтобы пользователи могли сосредоточиться на данных, среде и функции вознаграждения. README перечисляет заявленные преимущества, включая снижение затрат за счет мультиплексирования на общем инференс-кластере, более быстрое обучение за счет масштабирования до множества одновременных запросов на GPU, полностью управляемую инфраструктуру и мгновенное развертывание контрольных точек через W&B Inference. Короткий пример кода показывает регистрацию ServerlessBackend и TrainableModel.
Интеграции и наблюдаемость
ART рекламирует интеграции с хостируемыми платформами, такими как W&B, Langfuse и OpenPipe, для наблюдаемости и отладки. Также выделяются интеграция LangGraph для обучения агентов LangGraph, MCP•RL для обучения моделей использованию инструментов MCP-серверов, AutoRL для обучения без данных с автоматической генерацией входных данных и оценкой RULER, и RULER для автоматической генерации вознаграждений.
Статус проекта и лицензия
ART находится в активной разработке и приветствует вклад через CONTRIBUTING.md. Исходный код доступен под лицензией Apache-2.0. В README упоминаются Unsloth, vLLM, trl и torchtune как основополагающие проекты, а также включена цитата BibTeX.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.