প্রকল্প সম্পর্কে

ART (Agent Reinforcement Trainer) হল OpenPipe-এর একটি ওপেন-সোর্স রিইনফোর্সমেন্ট লার্নিং ফ্রেমওয়ার্ক যা LLM-ভিত্তিক এজেন্টদের অভিজ্ঞতা থেকে শিখতে দেয়। এর বিবৃত লক্ষ্য হল সাধারণ Python অ্যাপ্লিকেশনে GRPO (Group Relative Policy Optimization) প্রশিক্ষণ একীভূত করে এজেন্ট নির্ভরযোগ্যতা উন্নত করা, যাতে মাল্টি-স্টেপ এজেন্টরা বাস্তব-বিশ্বের কাজের জন্য কাজের-উপরোন্নত প্রশিক্ষণ পেতে পারে। স্থাপত্য ART কার্যকারিতাকে একটি ক্লায়েন্ট এবং একটি সার্ভারে বিভক্ত করে। ক্লায়েন্টটি OpenAI-সামঞ্জস্যপূর্ণ এবং আপনার বিদ্যমান কোডবেসের সাথে ইন্টারফেস করে: আপনি মেসেজ পাঠান এবং মডেল থেকে সম্পূর্ণতা গ্রহণ করেন যখন এটি উন্নত হয়। সার্ভারটি GPU সহ একটি মেশিনে স্বাধীনভাবে চলে এবং ইনফারেন্স ও প্রশিক্ষণের জটিলতা বিমূর্ত করে, তবুও কনফিগারেশনের অনুমতি দেয়। নথিভুক্ত প্রশিক্ষণ লুপটি নিম্নরূপ কাজ করে: 1. ইনফারেন্স: আপনার কোড একটি এজেন্টিক ওয়ার্কফ্লো চালায়, সাধারণত সমান্তরালে বেশ কয়েকটি রোলআউট। সম্পূর্ণতার অনুরোধ ART সার্ভারে রুট হয়, যা vLLM-এ মডেলের সর্বশেষ LoRA পরিবেশন করে। প্রতিটি সিস্টেম, ব্যবহারকারী এবং সহায়ক বার্তা একটি Trajectory-তে সংরক্ষিত হয় এবং যখন একটি রোলআউট শেষ হয়, আপনার কোড সেই Trajectory-তে একটি পুরস্কার নির্ধারণ করে। 2. প্রশিক্ষণ: সম্পন্ন Trajectories গোষ্ঠীভুক্ত হয়ে সার্ভারে পাঠানো হয় এবং প্রশিক্ষণ চলাকালীন ইনফারেন্স ব্লক করা হয়। সার্ভার সর্বশেষ চেকপয়েন্ট থেকে GRPO দিয়ে প্রশিক্ষণ দেয় (বা প্রথম পুনরাবৃত্তিতে একটি খালি LoRA), নতুন LoRA স্থানীয়ভাবে সংরক্ষণ করে, এটি vLLM-এ লোড করে এবং ইনফারেন্স আনব্লক করে। লুপটি কনফিগার করা সংখ্যক পুনরাবৃত্তির জন্য পুনরাবৃত্তি হয়। ইনস্টলেশন এবং ব্যবহার ART `pip install openpipe-art` দিয়ে ইনস্টল করা যায় এবং Python চালানো যেকোনো ক্লায়েন্ট মেশিন থেকে ব্যবহার করা যায়। README art.openpipe.ai-তে ডকুমেন্টেশন এবং Colab নোটবুকের একটি সেটের দিকে নির্দেশ করে যা উদাহরণ এজেন্ট কাজ কভার করে, যার মধ্যে ইমেল অনুসন্ধান (ART•E), 2048, LangGraph ইন্টিগ্রেশন, MCP সার্ভার দক্ষতা (MCP•RL), Temporal Clue, Tic Tac Toe, Codenames, RULER সহ AutoRL, এবং তত্ত্বাবধানে সূক্ষ্ম-টিউনিং উদাহরণ যেমন ডিস্টিলেশন এবং SFT ওয়ার্মআপ তারপর RL। নোটবুকগুলি হ্যান্ডস-অন ভূমিকা হিসাবে উপস্থাপিত হয়। মডেল সমর্থন ART-কে বেশিরভাগ vLLM/HuggingFace-transformers সামঞ্জস্যপূর্ণ কার্যকারণ ভাষা মডেলের সাথে কাজ করে বর্ণনা করা হয়েছে, বা অন্তত Unsloth দ্বারা সমর্থিত। README উল্লেখ করে যে Gemma 3 লেখার সময় সমর্থিত বলে মনে হয় না এবং Discord বা GitHub ইস্যুর মাধ্যমে অন্যান্য অসমর্থিত মডেলের রিপোর্ট আমন্ত্রণ জানায়। বিবরণে Qwen3.6, GPT-OSS এবং Llama সমর্থিত মডেলগুলির মধ্যে উল্লেখ করা হয়েছে। ঐচ্ছিক সার্ভারলেস প্রশিক্ষণ একটি পৃথক পরিচালিত পরিষেবা, W&B Training (Serverless RL), রিইনফোর্সমেন্ট লার্নিং দিয়ে নমনীয়ভাবে মডেল প্রশিক্ষণের জন্য প্রথম সর্বজনীন পরিষেবা হিসাবে উপস্থাপিত হয়। এটি প্রশিক্ষণ এবং ইনফারেন্স অবকাঠামো স্বয়ংক্রিয়ভাবে পরিচালনা করে যাতে ব্যবহারকারীরা ডেটা, পরিবেশ এবং পুরস্কার ফাংশনে ফোকাস করতে পারে। README দাবি করা সুবিধাগুলি তালিকাভুক্ত করে যার মধ্যে একটি ভাগ করা ইনফারেন্স ক্লাস্টারে মাল্টিপ্লেক্সিংয়ের মাধ্যমে কম খরচ, GPU জুড়ে অনেক সমান্তরাল অনুরোধে স্কেল করে দ্রুত প্রশিক্ষণ, সম্পূর্ণ পরিচালিত অবকাঠামো এবং W&B Inference-এর মাধ্যমে চেকপয়েন্টের তাত্ক্ষণিক স্থাপনা। একটি সংক্ষিপ্ত কোড উদাহরণ ServerlessBackend এবং TrainableModel নিবন্ধন দেখায়। ইন্টিগ্রেশন এবং পর্যবেক্ষণ ART পর্যবেক্ষণ এবং ডিবাগিংয়ের জন্য W&B, Langfuse এবং OpenPipe-এর মতো হোস্ট করা প্ল্যাটফর্মগুলির সাথে ইন্টিগ্রেশন বিজ্ঞাপন দেয়। এটি LangGraph এজেন্ট প্রশিক্ষণের জন্য LangGraph ইন্টিগ্রেশন, MCP সার্ভার সরঞ্জাম ব্যবহার করতে মডেল শেখানোর জন্য MCP•RL, স্বয়ংক্রিয় ইনপুট জেনারেশন এবং RULER মূল্যায়ন সহ শূন্য-ডেটা প্রশিক্ষণের জন্য AutoRL এবং স্বয়ংক্রিয় পুরস্কার জেনারেশনের জন্য RULER হাইলাইট করে। প্রকল্পের অবস্থা এবং লাইসেন্স ART সক্রিয় উন্নয়নের অধীনে রয়েছে এবং এর CONTRIBUTING.md-এর মাধ্যমে অবদান স্বাগত জানায়। সোর্স কোড Apache-2.0 লাইসেন্সের অধীনে উপলব্ধ। README Unsloth, vLLM, trl এবং torchtune-কে ভিত্তি প্রকল্প হিসাবে কৃতিত্ব দেয় এবং একটি BibTeX উদ্ধৃতি অন্তর্ভুক্ত করে।