このプロジェクトについて

ART(Agent Reinforcement Trainer)は、OpenPipeが開発したオープンソースの強化学習フレームワークで、LLMベースのエージェントが経験から学習できるようにします。その目標は、GRPO(Group Relative Policy Optimization)トレーニングを通常のPythonアプリケーションに統合することでエージェントの信頼性を向上させ、多段階エージェントが実世界のタスクで実地訓練を受けられるようにすることです。 アーキテクチャ ARTは機能をクライアントとサーバーに分離します。クライアントはOpenAI互換で、既存のコードベースとインターフェースします:メッセージを渡し、モデルが改善されるにつれて完了を受け取ります。サーバーはGPUを搭載したマシンで独立して実行され、推論とトレーニングの複雑さを抽象化しつつ、設定も可能にします。 文書化されたトレーニングループは以下のように機能します: 1. 推論:コードがエージェントワークフローを実行し、通常は複数のロールアウトを並行して行います。完了リクエストはARTサーバーにルーティングされ、サーバーはvLLMでモデルの最新LoRAを提供します。各システム、ユーザー、アシスタントメッセージはTrajectoryに保存され、ロールアウトが終了するとコードがそのTrajectoryに報酬を割り当てます。 2. トレーニング:完了したTrajectoryはグループ化されてサーバーに送信され、トレーニング中は推論がブロックされます。サーバーは最新のチェックポイント(または最初の反復では空のLoRA)からGRPOでトレーニングし、新しいLoRAをローカルに保存し、vLLMにロードして、推論のブロックを解除します。このループは設定された反復回数だけ繰り返されます。 インストールと使用法 ARTは`pip install openpipe-art`でインストールでき、Pythonを実行する任意のクライアントマシンから使用できます。READMEはart.openpipe.aiのドキュメントと、メール検索(ART•E)、2048、LangGraph統合、MCPサーバーマスタリー(MCP•RL)、Temporal Clue、Tic Tac Toe、Codenames、RULERを使用したAutoRL、蒸留やSFTウォームアップ後のRLなどの教師あり微調整例を含む一連のColabノートブックを指しています。ノートブックは実践的な入門として提示されています。 モデルサポート ARTは、ほとんどのvLLM/HuggingFace-transformers互換の因果言語モデル、または少なくともUnslothがサポートするモデルで動作すると説明されています。READMEは、執筆時点でGemma 3がサポートされていないようであり、他のサポートされていないモデルはDiscordまたはGitHub issuesで報告するよう求めています。説明では、サポートされているモデルとしてQwen3.6、GPT-OSS、Llamaが言及されています。 オプションのサーバーレストレーニング 別のマネージドサービスであるW&B Training(Serverless RL)は、強化学習でモデルを柔軟にトレーニングするための最初の公開サービスとして提示されています。トレーニングと推論インフラを自動的に管理するため、ユーザーはデータ、環境、報酬関数に集中できます。READMEは、共有推論クラスターでの多重化による低コスト、複数のGPUにわたる多数の同時リクエストへのスケーリングによる高速トレーニング、完全に管理されたインフラ、W&B Inferenceによるチェックポイントの即時デプロイなど、主張される利点をリストしています。短いコード例は、ServerlessBackendとTrainableModelの登録を示しています。 統合と可観測性 ARTは、可観測性とデバッグのためにW&B、Langfuse、OpenPipeなどのホスト型プラットフォームとの統合を宣伝しています。また、LangGraphエージェントのトレーニングのためのLangGraph統合、MCPサーバーツールの使用をモデルに教えるためのMCP•RL、自動入力生成とRULER評価によるゼロデータトレーニングのためのAutoRL、自動報酬生成のためのRULERも強調しています。 プロジェクトの状態とライセンス ARTは活発に開発中であり、CONTRIBUTING.mdを通じて貢献を歓迎しています。ソースコードはApache-2.0ライセンスで利用可能です。READMEは、Unsloth、vLLM、trl、torchtuneを基盤プロジェクトとしてクレジットし、BibTeX引用を含んでいます。