इस प्रोजेक्ट के बारे में

ART (Agent Reinforcement Trainer) OpenPipe का एक ओपन-सोर्स रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो LLM-आधारित एजेंटों को अनुभव से सीखने देता है। इसका कथित लक्ष्य सामान्य Python अनुप्रयोगों में GRPO (Group Relative Policy Optimization) प्रशिक्षण को एकीकृत करके एजेंट विश्वसनीयता में सुधार करना है, ताकि मल्टी-स्टेप एजेंट वास्तविक दुनिया के कार्यों के लिए ऑन-द-जॉब प्रशिक्षण प्राप्त कर सकें। आर्किटेक्चर ART कार्यक्षमता को क्लाइंट और सर्वर में विभाजित करता है। क्लाइंट OpenAI-संगत है और आपके मौजूदा कोडबेस के साथ इंटरफेस करता है: आप संदेश भेजते हैं और मॉडल के बेहतर होने पर उससे पूर्णताएँ प्राप्त करते हैं। सर्वर GPU वाले मशीन पर स्वतंत्र रूप से चलता है और इन्फ्रेंस तथा प्रशिक्षण जटिलता को सारगर्भित करता है, जबकि कॉन्फ़िगरेशन की अनुमति देता है। प्रलेखित प्रशिक्षण लूप इस प्रकार काम करता है: 1. इन्फ्रेंस: आपका कोड एजेंटिक वर्कफ़्लो चलाता है, आमतौर पर समानांतर में कई रोलआउट। पूर्णता अनुरोध ART सर्वर पर रूट होते हैं, जो vLLM में मॉडल का नवीनतम LoRA परोसता है। प्रत्येक सिस्टम, उपयोगकर्ता और सहायक संदेश एक Trajectory में संग्रहीत होता है, और जब रोलआउट समाप्त होता है तो आपका कोड उस Trajectory को एक पुरस्कार निर्दिष्ट करता है। 2. प्रशिक्षण: समाप्त Trajectories को समूहीकृत कर सर्वर को भेजा जाता है, और प्रशिक्षण चलने के दौरान इन्फ्रेंस अवरुद्ध होता है। सर्वर नवीनतम चेकपॉइंट (या पहले पुनरावृत्ति पर खाली LoRA) से शुरू करके GRPO के साथ प्रशिक्षित करता है, नए LoRA को स्थानीय रूप से सहेजता है, इसे vLLM में लोड करता है, और इन्फ्रेंस को अनब्लॉक करता है। लूप कॉन्फ़िगर किए गए पुनरावृत्तियों की संख्या के लिए दोहराता है। स्थापना और उपयोग ART को `pip install openpipe-art` के साथ स्थापित किया जा सकता है और Python चलाने वाले किसी भी क्लाइंट मशीन से उपयोग किया जा सकता है। README art.openpipe.ai पर दस्तावेज़ीकरण और उदाहरण एजेंट कार्यों को कवर करने वाले Colab नोटबुक्स के सेट की ओर इशारा करता है, जिसमें ईमेल खोज (ART•E), 2048, LangGraph एकीकरण, MCP सर्वर मास्टरी (MCP•RL), Temporal Clue, Tic Tac Toe, Codenames, RULER के साथ AutoRL, और पर्यवेक्षित फाइन-ट्यूनिंग उदाहरण जैसे आसवन और SFT वार्मअप के बाद RL शामिल हैं। नोटबुक्स को व्यावहारिक परिचय के रूप में प्रस्तुत किया गया है। मॉडल समर्थन ART को अधिकांश vLLM/HuggingFace-transformers संगत कारणात्मक भाषा मॉडल के साथ काम करने के रूप में वर्णित किया गया है, या कम से कम उन मॉडलों के साथ जो Unsloth द्वारा समर्थित हैं। README नोट करता है कि Gemma 3 लेखन के समय समर्थित नहीं दिखता है और Discord या GitHub मुद्दों के माध्यम से अन्य असमर्थित मॉडलों की रिपोर्ट आमंत्रित करता है। विवरण में समर्थित मॉडलों में Qwen3.6, GPT-OSS और Llama का उल्लेख है। वैकल्पिक सर्वरलेस प्रशिक्षण एक अलग प्रबंधित सेवा, W&B Training (Serverless RL), रीइन्फोर्समेंट लर्निंग के साथ मॉडलों को लचीले ढंग से प्रशिक्षित करने के लिए पहली सार्वजनिक रूप से उपलब्ध सेवा के रूप में प्रस्तुत की गई है। यह प्रशिक्षण और इन्फ्रेंस बुनियादी ढांचे को स्वचालित रूप से प्रबंधित करता है ताकि उपयोगकर्ता डेटा, पर्यावरण और पुरस्कार फ़ंक्शन पर ध्यान केंद्रित कर सकें। README में दावा किए गए लाभों की सूची है जिसमें साझा इन्फ्रेंस क्लस्टर पर मल्टीप्लेक्सिंग के माध्यम से कम लागत, GPUs में कई समवर्ती अनुरोधों को स्केल करके तेज़ प्रशिक्षण, पूरी तरह से प्रबंधित बुनियादी ढांचा, और W&B Inference के माध्यम से चेकपॉइंट्स की तत्काल तैनाती शामिल है। एक छोटा कोड उदाहरण ServerlessBackend और TrainableModel पंजीकरण दिखाता है। एकीकरण और अवलोकनीयता ART W&B, Langfuse और OpenPipe जैसे होस्टेड प्लेटफ़ॉर्म के साथ अवलोकनीयता और डिबगिंग के लिए एकीकरण का विज्ञापन करता है। यह LangGraph एजेंटों को प्रशिक्षित करने के लिए LangGraph एकीकरण, MCP सर्वर टूल का उपयोग करने के लिए मॉडल सिखाने के लिए MCP•RL, स्वचालित इनपुट जनरेशन और RULER मूल्यांकन के साथ शून्य-डेटा प्रशिक्षण के लिए AutoRL, और स्वचालित पुरस्कार जनरेशन के लिए RULER को भी उजागर करता है। परियोजना स्थिति और लाइसेंसिंग ART सक्रिय विकास के अधीन है और अपने CONTRIBUTING.md के माध्यम से योगदान का स्वागत करता है। स्रोत कोड Apache-2.0 लाइसेंस के तहत उपलब्ध है। README Unsloth, vLLM, trl और torchtune को मूलभूत परियोजनाओं के रूप में श्रेय देता है, और एक BibTeX उद्धरण शामिल करता है।